คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 248/303 ตอน ดูสารบัญคอร์ส

OpenAI เปิดผลทดสอบชุดแรกของชิปอินเฟอเรนซ์ Jalapeño ที่พัฒนาเอง เร็วขึ้น 1.7–3.6 เท่า แต่จะผลิตจำนวนมากในปี 2570

28/08/2026 274
≈4:44
OpenAI เปิดผลทดสอบชุดแรกของชิปอินเฟอเรนซ์ Jalapeño ที่พัฒนาเอง เร็วขึ้น 1.7–3.6 เท่า แต่จะผลิตจำนวนมากในปี 2570
ภาพ/Photo by BoliviaInteligente on Unsplash

OpenAI เปิดเผยผลการทดสอบมาตรฐานชุดแรกของหน่วยประมวลผลอินเฟอเรนซ์ Jalapeño ที่พัฒนาร่วมกับ Broadcom ในงาน Hot Chips 2026 โดยเวลาตอบสนองแบบครบวงจรเร็วกว่าการกำหนดค่ามาตรฐานเชิงพาณิชย์ 1.7 ถึง 3.6 เท่า แต่ชิปยังไม่เข้าสู่การผลิตจำนวนมาก ปลายปี 2569 จะติดตั้งเพียงจำนวนน้อยมาก และจะขยายขนาดในปี 2570

เมื่อวันที่ 25 สิงหาคม 2569 ตามเวลาฝั่งตะวันตกของสหรัฐฯ OpenAI ได้เปิดเผยผลการทดสอบมาตรฐานชุดแรกของหน่วยประมวลผลอินเฟอเรนซ์ชื่อ Jalapeño ในงานประชุม Hot Chips 2026 พร้อมเผยแพร่ข้อมูลบนหน้าเว็บทางการ openai.com/index/jalapeno-first-results/ นี่คือชิปเฉพาะทางสำหรับงานอินเฟอเรนซ์ตัวแรกที่ OpenAI ออกแบบเอง โดยพัฒนาร่วมกับ Broadcom

มีประเด็นหนึ่งที่ต้องระบุให้ชัดเจนก่อน สิ่งที่เปิดเผยครั้งนี้คือ «ผลการทดสอบมาตรฐาน» ไม่ใช่การวางจำหน่ายผลิตภัณฑ์ OpenAI ระบุชัดว่ากำหนดการติดตั้งคือปลายปี 2569 จะมีเพียง «จำนวนน้อยมาก (very small volumes)» และจะขยายเป็นขนาดที่มีนัยสำคัญในปี 2570 อีกทั้งยังไม่มีการประกาศราคาและรายละเอียดกระบวนการผลิต กล่าวคือ ขณะนี้ยังไม่มีใครสามารถซื้อหรือใช้งาน Jalapeño ได้

ตัวเลขที่เปิดเผย

OpenAI ใช้เกณฑ์มาตรฐาน InferenceX ของ SemiAnalysis ในการทดสอบจริง โดยผลลัพธ์สำคัญมีสามข้อ

  1. ด้าน «จำนวนโทเคนต่อผู้ใช้ (tokens per user)» ทำได้เหนือกว่าหน่วยประมวลผลอินเฟอเรนซ์ที่ล้ำหน้าที่สุดในปัจจุบัน
  2. ด้าน «ปริมาณงานต่อกิโลวัตต์ (throughput per kilowatt)» ก็เหนือกว่าเช่นกัน หมายความว่าที่กำลังไฟเท่ากันสามารถสร้างโทเคนได้มากกว่า
  3. เวลาตอบสนองแบบครบวงจรเร็วกว่าการกำหนดค่ามาตรฐานเชิงพาณิชย์ 1.7 ถึง 3.6 เท่า ทั้งนี้ทางการไม่ได้อธิบายสาเหตุของช่วงที่ต่างกัน

สื่อหลายสำนักรายงานว่าคู่เปรียบเทียบรวมถึงระบบ NVIDIA Blackwell ทั้งนี้ตัวเลขเหล่านี้มาจากผู้ออกแบบชิปเอง และทางการไม่ได้กล่าวถึงการทดสอบซ้ำอย่างอิสระโดยบุคคลที่สาม

แนวคิดสถาปัตยกรรม ลดการเคลื่อนย้ายข้อมูล

แนวทางออกแบบของ Jalapeño ไม่ใช่การเพิ่มพลังประมวลผล แต่คือการตัดความหน่วง OpenAI ชี้ว่าขั้นตอนที่มักเป็นคอขวดของอินเฟอเรนซ์มีสองช่วง คือ prefill (การอ่านคำสั่งเข้ามาและสร้างสถานะเริ่มต้น) และช่วงการสื่อสารระหว่างชิป ทั้งสองช่วงมีลักษณะร่วมกันคือมีข้อมูลจำนวนมากเคลื่อนย้ายไปมาระหว่างหน่วยความจำกับชิป ต่อให้พลังประมวลผลสูงแค่ไหนก็ต้องรอ

ดังนั้น Jalapeño จึงลดการเคลื่อนย้ายข้อมูล และทำให้ KV cache (แคชคีย์-แวลูที่โมเดลอ่านซ้ำระหว่างการสร้างข้อความ) อยู่ในตำแหน่งเดิมใกล้หน่วยคำนวณมากที่สุด นี่อธิบายว่าทำไมการปรับปรุงจึงสะท้อนที่ «เวลาตอบสนอง» และ «ประสิทธิภาพต่อกิโลวัตต์» มากกว่าตัวเลขพลังประมวลผลสูงสุด สิ่งที่ประหยัดได้คือเวลารอและไฟฟ้า ไม่ใช่การคำนวณ

ทำไมบริษัทโมเดลจึงทำชิปเอง

OpenAI วางตำแหน่ง Jalapeño เป็นแพลตฟอร์มข้ามรุ่นที่รวมผลิตภัณฑ์ AI โมเดล ชิป และหน่วยความจำเข้าด้วยกัน เมื่อมองในบริบทอุตสาหกรรมปี 2569 ก้าวนี้ไม่ได้เกิดขึ้นโดดเดี่ยว เมื่อวันที่ 24 สิงหาคม NVIDIA เพิ่งประกาศผลิต Groq 3 LPX เต็มกำลัง การแข่งขันของซิลิคอนเฉพาะทางด้านอินเฟอเรนซ์กลายเป็นเส้นเรื่องหลักของปีนี้ ความต่างคือ NVIDIA ขายชิปให้ทุกคน ส่วน OpenAI ทำชิปเพื่อป้อนบริการของตนเอง

ความหมายต่อผู้บริหาร

การที่ผู้ให้บริการโมเดลสร้างซิลิคอนอินเฟอเรนซ์เอง คือการขยับเส้นพื้นฐานของ «ต้นทุนต่อการเรียกใช้หนึ่งครั้งและความหน่วง» สำหรับองค์กรที่นำ AI เข้าไปใช้ในงานบริการลูกค้า งานเอกสาร หรือการตรวจสอบกระบวนการแล้ว การเปลี่ยนแปลงของราคา API และความเร็วในอีกสองปีข้างหน้าอาจไม่ได้มาจากการอัปเดตเวอร์ชันโมเดลเพียงอย่างเดียว แต่มาจากการเปลี่ยนรุ่นฮาร์ดแวร์ของผู้ให้บริการด้วย สิ่งที่ควรทำตั้งแต่ตอนนี้คือแยกโครงสร้างต้นทุนของงาน AI ในองค์กรออกมาดูให้ชัด ว่ากระบวนการใดอ่อนไหวต่อความหน่วง กระบวนการใดรันเป็นชุดก็เพียงพอ และกระบวนการใดผูกติดกับผู้ให้บริการรายเดียว เมื่อฮาร์ดแวร์เปลี่ยนรุ่นจริงในปี 2570 และโครงสร้างราคาขยับตาม ผู้ที่มีตารางนี้อยู่ในมือจึงจะมีพื้นที่ในการเจรจาและย้ายระบบ

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Claude เปิดความสามารถด้านเบราว์เซอร์พร้อมกันสองเรื่อง: Chrome ขึ้นสถานะ GA และ Cowork มีเบราว์เซอร์ในตัว

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว