Google เปิดตัว Gemini 4 Argon: ขยายเพดานเอาต์พุตสู่ 1 ล้านโทเคน เปิดใช้แบบจำกัดให้ผู้ป้องกันด้านความปลอดภัยไซเบอร์ก่อน
เมื่อวันที่ 30 กันยายน พ.ศ. 2569 Google เปิดตัวโมเดลระดับแนวหน้ารุ่นใหม่ Gemini 4 Argon เพิ่มเพดานเอาต์พุตต่อครั้งจาก 64K เป็น 1 ล้านโทเคน ทำคะแนน DeepSWE v1.1 ได้ 77.9% และ CWE-bench v1 ได้ 68% ครองอันดับหนึ่งร่วม ปัจจุบันเปิดให้เฉพาะผู้ป้องกันด้านความปลอดภัยไซเบอร์ที่ได้รับความไว้วางใจ พร้อมนำโมเดลเข้าร่วมการตรวจสอบก่อนเปิดตัวแบบสมัครใจของรัฐบาลสหรัฐฯ ผู้ใช้ทั่วไปยังใช้งานไม่ได้ ขณะที่ Bloomberg รายงานในวันเดียวกันว่าภายในบริษัทยังมีข้อกังขาต่อความสามารถเขียนโปรแกรมในงานจริง
เมื่อวันที่ 30 กันยายน พ.ศ. 2569 Google ประกาศผ่านบล็อกทางการถึงการเปิดตัวโมเดลระดับแนวหน้ารุ่นใหม่ชื่อ Gemini 4 Argon โดยใช้รูปแบบ “เปิดตัวแบบจำกัด” ระยะแรกเปิดให้ใช้ผ่าน Fairwind Program เฉพาะผู้ป้องกันด้านความปลอดภัยไซเบอร์ที่ผ่านการคัดกรองและได้รับความไว้วางใจ พร้อมนำโมเดลเข้าร่วมการตรวจสอบก่อนเปิดตัวแบบสมัครใจของรัฐบาลสหรัฐฯ บริษัทระบุว่าขั้นต่อไปจะเปิดผ่าน API แบบชำระเงินและแพ็กเกจ Google AI Ultra ก่อน แต่ยังไม่ระบุวันที่แน่ชัด กล่าวคือ ขณะนี้องค์กรและผู้ใช้ทั่วไปยังไม่สามารถใช้งานโมเดลนี้ได้ สิ่งที่เห็นได้มีเพียงสเปกและผลทดสอบที่บริษัทประกาศเท่านั้น
สเปกสำคัญ: เพดานเอาต์พุตจาก 64K สู่ 1 ล้านโทเคน
การเปลี่ยนแปลงที่ได้รับความสนใจที่สุดคือเพดานเอาต์พุตต่อครั้ง ซึ่งเพิ่มจาก 64K โทเคนในรุ่นก่อนเป็น 1 ล้านโทเคน หรือมากกว่าเดิมราว 15 เท่า ที่ผ่านมาโมเดล “อ่านได้มากแต่เขียนได้น้อย” เมื่อต้องสร้างรายงานยาวหรือโค้ดทั้งระบบ มักต้องแบ่งสร้างทีละส่วนแล้วนำมาต่อกันเอง การขยายเพดานครั้งนี้ทำให้การส่งมอบงานฉบับสมบูรณ์ในครั้งเดียวเป็นไปได้ในเชิงเทคนิค ผลทดสอบที่บริษัทประกาศมีสามรายการ ดังนี้
- DeepSWE v1.1: 77.9%
- CWE-bench v1: 68% ครองอันดับหนึ่งร่วมกับโมเดลอื่น
- AutomationBench: 51.3%
ด้านราคา ช่วงโปรโมชันของ API อยู่ที่ 2 ดอลลาร์สหรัฐต่อล้านโทเคนสำหรับอินพุต และ 10 ดอลลาร์สหรัฐสำหรับเอาต์พุต หลังหมดโปรโมชันจะปรับเป็น 4 ดอลลาร์สหรัฐและ 20 ดอลลาร์สหรัฐตามลำดับ หรือเพิ่มขึ้นเท่าตัว การประเมินต้นทุนระยะยาวจึงควรใช้ราคาหลังโปรโมชันเป็นเกณฑ์
ทำไมจึงเปิดให้ผู้ป้องกันด้านไซเบอร์ก่อน
CWE-bench เป็นการทดสอบที่ตั้งชื่อตามช่องโหว่ของซอฟต์แวร์ คะแนนที่ครองอันดับหนึ่งร่วมแสดงว่าโมเดลทำงานลักษณะนี้ได้โดดเด่น ความสามารถนี้เป็นดาบสองคม ฝ่ายป้องกันใช้อุดช่องโหว่ล่วงหน้าได้ แต่ฝ่ายโจมตีก็อาจใช้หาจุดอ่อนได้เช่นกัน การที่ Google ให้ผู้ป้องกันที่ไว้วางใจได้ใช้ก่อน ควบคู่กับการตรวจสอบของรัฐบาลสหรัฐฯ อาจตีความได้ว่าเป็นแนวทางระมัดระวังแบบ “สังเกตความเสี่ยงก่อนแล้วค่อยขยายการเปิด” สะท้อนว่าการเปิดตัวโมเดลระดับแนวหน้าให้ความสำคัญกับการควบคุมความปลอดภัยมากขึ้น
ปฏิกิริยาในวงการ: คะแนนโดดเด่น แต่งานจริงยังมีคำถาม
ในวันเปิดตัว Bloomberg รายงานว่าภายใน Google เองยังมีข้อกังขาต่อความสามารถเขียนโปรแกรมของ Gemini 4 Argon ในงานจริง ข้อนี้เตือนว่าคะแนนทดสอบได้มาจากโจทย์มาตรฐาน ขณะที่โครงการจริงมีความต้องการที่คลุมเครือ โค้ดเก่า และระบบที่เชื่อมโยงกันซับซ้อน ผลลัพธ์จึงอาจไม่สอดคล้องกับคะแนนเสมอไป
ความหมายต่อผู้บริหาร
ข่าวนี้ให้ข้อคิดโดยตรงแก่ผู้บริหารสองประการ ดังนี้
- หากเอาต์พุตระดับล้านโทเคนใช้ได้จริง งานแบบ “ส่งมอบทั้งชุด” เช่น เอกสารขนาดยาวหรือโค้ดทั้งระบบ อาจให้ AI ทำเสร็จได้ในครั้งเดียว จึงควรเริ่มทบทวนว่ากระบวนการใดเหมาะสม
- โมเดลยังไม่เปิดให้ใช้ทั่วไปและความเห็นภายในก็ยังแตกต่าง จึงไม่จำเป็นต้องรีบปรับการจัดซื้อหรือกระบวนการ แนวทางที่เหมาะสมกว่าคือติดตามกำหนดเปิดใช้อย่างเป็นทางการและผลทดสอบจากบุคคลที่สาม พร้อมนำราคาหลังโปรโมชันมาประกอบการวางงบประมาณ
ดูให้ชัดก่อน แล้วจึงตัดสินใจว่าจะตามหรือไม่
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี