OpenAI เปิดผลทดสอบชุดแรกของชิปอินเฟอเรนซ์ Jalapeño ที่พัฒนาเอง เร็วขึ้น 1.7–3.6 เท่า แต่จะผลิตจำนวนมากในปี 2570
OpenAI เปิดเผยผลการทดสอบมาตรฐานชุดแรกของหน่วยประมวลผลอินเฟอเรนซ์ Jalapeño ที่พัฒนาร่วมกับ Broadcom ในงาน Hot Chips 2026 โดยเวลาตอบสนองแบบครบวงจรเร็วกว่าการกำหนดค่ามาตรฐานเชิงพาณิชย์ 1.7 ถึง 3.6 เท่า แต่ชิปยังไม่เข้าสู่การผลิตจำนวนมาก ปลายปี 2569 จะติดตั้งเพียงจำนวนน้อยมาก และจะขยายขนาดในปี 2570
เมื่อวันที่ 25 สิงหาคม 2569 ตามเวลาฝั่งตะวันตกของสหรัฐฯ OpenAI ได้เปิดเผยผลการทดสอบมาตรฐานชุดแรกของหน่วยประมวลผลอินเฟอเรนซ์ชื่อ Jalapeño ในงานประชุม Hot Chips 2026 พร้อมเผยแพร่ข้อมูลบนหน้าเว็บทางการ openai.com/index/jalapeno-first-results/ นี่คือชิปเฉพาะทางสำหรับงานอินเฟอเรนซ์ตัวแรกที่ OpenAI ออกแบบเอง โดยพัฒนาร่วมกับ Broadcom
มีประเด็นหนึ่งที่ต้องระบุให้ชัดเจนก่อน สิ่งที่เปิดเผยครั้งนี้คือ «ผลการทดสอบมาตรฐาน» ไม่ใช่การวางจำหน่ายผลิตภัณฑ์ OpenAI ระบุชัดว่ากำหนดการติดตั้งคือปลายปี 2569 จะมีเพียง «จำนวนน้อยมาก (very small volumes)» และจะขยายเป็นขนาดที่มีนัยสำคัญในปี 2570 อีกทั้งยังไม่มีการประกาศราคาและรายละเอียดกระบวนการผลิต กล่าวคือ ขณะนี้ยังไม่มีใครสามารถซื้อหรือใช้งาน Jalapeño ได้
ตัวเลขที่เปิดเผย
OpenAI ใช้เกณฑ์มาตรฐาน InferenceX ของ SemiAnalysis ในการทดสอบจริง โดยผลลัพธ์สำคัญมีสามข้อ
- ด้าน «จำนวนโทเคนต่อผู้ใช้ (tokens per user)» ทำได้เหนือกว่าหน่วยประมวลผลอินเฟอเรนซ์ที่ล้ำหน้าที่สุดในปัจจุบัน
- ด้าน «ปริมาณงานต่อกิโลวัตต์ (throughput per kilowatt)» ก็เหนือกว่าเช่นกัน หมายความว่าที่กำลังไฟเท่ากันสามารถสร้างโทเคนได้มากกว่า
- เวลาตอบสนองแบบครบวงจรเร็วกว่าการกำหนดค่ามาตรฐานเชิงพาณิชย์ 1.7 ถึง 3.6 เท่า ทั้งนี้ทางการไม่ได้อธิบายสาเหตุของช่วงที่ต่างกัน
สื่อหลายสำนักรายงานว่าคู่เปรียบเทียบรวมถึงระบบ NVIDIA Blackwell ทั้งนี้ตัวเลขเหล่านี้มาจากผู้ออกแบบชิปเอง และทางการไม่ได้กล่าวถึงการทดสอบซ้ำอย่างอิสระโดยบุคคลที่สาม
แนวคิดสถาปัตยกรรม ลดการเคลื่อนย้ายข้อมูล
แนวทางออกแบบของ Jalapeño ไม่ใช่การเพิ่มพลังประมวลผล แต่คือการตัดความหน่วง OpenAI ชี้ว่าขั้นตอนที่มักเป็นคอขวดของอินเฟอเรนซ์มีสองช่วง คือ prefill (การอ่านคำสั่งเข้ามาและสร้างสถานะเริ่มต้น) และช่วงการสื่อสารระหว่างชิป ทั้งสองช่วงมีลักษณะร่วมกันคือมีข้อมูลจำนวนมากเคลื่อนย้ายไปมาระหว่างหน่วยความจำกับชิป ต่อให้พลังประมวลผลสูงแค่ไหนก็ต้องรอ
ดังนั้น Jalapeño จึงลดการเคลื่อนย้ายข้อมูล และทำให้ KV cache (แคชคีย์-แวลูที่โมเดลอ่านซ้ำระหว่างการสร้างข้อความ) อยู่ในตำแหน่งเดิมใกล้หน่วยคำนวณมากที่สุด นี่อธิบายว่าทำไมการปรับปรุงจึงสะท้อนที่ «เวลาตอบสนอง» และ «ประสิทธิภาพต่อกิโลวัตต์» มากกว่าตัวเลขพลังประมวลผลสูงสุด สิ่งที่ประหยัดได้คือเวลารอและไฟฟ้า ไม่ใช่การคำนวณ
ทำไมบริษัทโมเดลจึงทำชิปเอง
OpenAI วางตำแหน่ง Jalapeño เป็นแพลตฟอร์มข้ามรุ่นที่รวมผลิตภัณฑ์ AI โมเดล ชิป และหน่วยความจำเข้าด้วยกัน เมื่อมองในบริบทอุตสาหกรรมปี 2569 ก้าวนี้ไม่ได้เกิดขึ้นโดดเดี่ยว เมื่อวันที่ 24 สิงหาคม NVIDIA เพิ่งประกาศผลิต Groq 3 LPX เต็มกำลัง การแข่งขันของซิลิคอนเฉพาะทางด้านอินเฟอเรนซ์กลายเป็นเส้นเรื่องหลักของปีนี้ ความต่างคือ NVIDIA ขายชิปให้ทุกคน ส่วน OpenAI ทำชิปเพื่อป้อนบริการของตนเอง
ความหมายต่อผู้บริหาร
การที่ผู้ให้บริการโมเดลสร้างซิลิคอนอินเฟอเรนซ์เอง คือการขยับเส้นพื้นฐานของ «ต้นทุนต่อการเรียกใช้หนึ่งครั้งและความหน่วง» สำหรับองค์กรที่นำ AI เข้าไปใช้ในงานบริการลูกค้า งานเอกสาร หรือการตรวจสอบกระบวนการแล้ว การเปลี่ยนแปลงของราคา API และความเร็วในอีกสองปีข้างหน้าอาจไม่ได้มาจากการอัปเดตเวอร์ชันโมเดลเพียงอย่างเดียว แต่มาจากการเปลี่ยนรุ่นฮาร์ดแวร์ของผู้ให้บริการด้วย สิ่งที่ควรทำตั้งแต่ตอนนี้คือแยกโครงสร้างต้นทุนของงาน AI ในองค์กรออกมาดูให้ชัด ว่ากระบวนการใดอ่อนไหวต่อความหน่วง กระบวนการใดรันเป็นชุดก็เพียงพอ และกระบวนการใดผูกติดกับผู้ให้บริการรายเดียว เมื่อฮาร์ดแวร์เปลี่ยนรุ่นจริงในปี 2570 และโครงสร้างราคาขยับตาม ผู้ที่มีตารางนี้อยู่ในมือจึงจะมีพื้นที่ในการเจรจาและย้ายระบบ
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี