Google เปิดตัว Gemini 1.5 Pro หน้าต่างบริบทระดับล้านโทเคนคืออะไร
วันที่ 15 กุมภาพันธ์ 2567 Google เปิดตัวโมเดลรุ่นใหม่ Gemini 1.5 ด้วยสถาปัตยกรรม Mixture-of-Experts รุ่นเรือธง Gemini 1.5 Pro มีประสิทธิภาพใกล้เคียงโมเดลที่ใหญ่ที่สุดในตระกูล 1.0 Ultra จุดเด่นสำคัญคือรองรับหน้าต่างบริบทยาวถึง 1 ล้านโทเคน เทียบเท่าวิดีโอ 1 ชั่วโมง เสียง 11 ชั่วโมง หรือโค้ดโปรแกรมกว่า 30,000 บรรทัด ขณะนี้เปิดให้นักพัฒนาและลูกค้าองค์กรทดลองใช้แบบจำกัด
วันที่ 15 กุมภาพันธ์ 2567 Google ประกาศเปิดตัวโมเดลตระกูลใหม่ Gemini 1.5 ห่างจากการเปิดตัว Gemini 1.0 อย่างเป็นทางการไม่ถึงสามเดือน จุดสำคัญของการเปิดตัวครั้งนี้คือรุ่นเรือธงตัวแรก Gemini 1.5 Pro ซึ่งใช้สถาปัตยกรรมที่ต่างจากรุ่นก่อนหน้า เรียกว่า Mixture-of-Experts (การผสมผสานผู้เชี่ยวชาญ หรือ MoE) สถาปัตยกรรมนี้ทำให้โมเดลเปิดใช้งานเฉพาะเครือข่ายย่อยผู้เชี่ยวชาญบางส่วนเพื่อประมวลผลงานเฉพาะทาง แทนที่จะเรียกใช้ทั้งโมเดลทุกครั้ง ส่งผลให้ลดต้นทุนการฝึกฝนและการประมวลผลได้มาก ในขณะที่ยังคงหรือเพิ่มประสิทธิภาพได้ ตามผลการทดสอบมาตรฐานที่ Google เผยแพร่ Gemini 1.5 Pro มีคะแนนเหนือกว่ารุ่นก่อนหน้า 1.0 Pro ในการทดสอบส่วนใหญ่ และมีประสิทธิภาพใกล้เคียงกับ 1.0 Ultra ซึ่งเป็นโมเดลที่ทรงพลังที่สุดของ Google ในขณะนั้น
แต่สิ่งที่ทำให้วงการให้ความสนใจอย่างแท้จริง ไม่ใช่คะแนนมาตรฐานที่เพิ่มขึ้น แต่เป็นสเปกของหน้าต่างบริบท (context window) Gemini 1.5 Pro สามารถประมวลผลข้อมูลนำเข้าได้อย่างเสถียรยาวถึง 1 ล้านโทเคน เทียบเท่ากับวิดีโอความยาว 1 ชั่วโมง เสียงความยาว 11 ชั่วโมง หรือโค้ดโปรแกรมกว่า 30,000 บรรทัด และเอกสารข้อความกว่า 700,000 คำ ตัวเลขนี้ถือเป็นหน้าต่างบริบทที่ยาวที่สุดที่มีการเปิดเผยต่อสาธารณะในขณะนั้น ยาวกว่า GPT-4 Turbo ของ OpenAI ที่ 128,000 โทเคน และยาวกว่า Claude 2.1 ของ Anthropic ที่ 200,000 โทเคนอย่างมาก ขณะนี้ Gemini 1.5 Pro ยังไม่เปิดให้ใช้งานแบบเต็มรูปแบบ แต่เปิดเป็นการทดลองใช้แบบจำกัด (limited preview) ผ่าน Google AI Studio และ Vertex AI สำหรับนักพัฒนาและลูกค้าองค์กรที่ยื่นขอทดลองใช้
ความหมายเชิงเทคนิค เหตุใดความยาวบริบทจึงเป็นตัวชี้วัดสำคัญ
ในอดีตโมเดลภาษาขนาดใหญ่ถูกจำกัดด้วยขนาดหน้าต่างบริบท เมื่อต้องประมวลผลเอกสารยาวหรือวิดีโอยาว มักต้องตัดเนื้อหาเป็นชิ้นเล็กแล้วป้อนให้โมเดลทีละส่วน จากนั้นจึงต่อคำตอบเข้าด้วยกันเอง กระบวนการนี้เสี่ยงต่อการหลุดข้อมูลที่เชื่อมโยงกันระหว่างชิ้นส่วนต่าง ๆ หน้าต่างบริบทระดับ 1 ล้านโทเคน หมายความว่าโมเดลสามารถอ่านจบสัญญาฉบับยาวทั้งฉบับ วิดีโอประชุมทั้งงาน หรือแม้แต่โค้ดเบสทั้งชุดได้ในครั้งเดียว และยังระบุรายละเอียดเฉพาะจุดได้อย่างแม่นยำ หนึ่งในการทดสอบที่ Google สาธิตตอนเปิดตัว คือให้โมเดลค้นหาประโยคหนึ่งที่ถูกซ่อนไว้โดยตั้งใจในเอกสารความยาวเกือบ 700,000 คำ ซึ่งโมเดลสามารถค้นหาและตอบได้อย่างแม่นยำ ความสามารถนี้เรียกว่าการค้นคืนบริบทยาว (needle-in-a-haystack) ถือเป็นตัวชี้วัดสำคัญในการประเมินว่าโมเดลบริบทยาวนั้นอ่านเข้าใจจริง หรือเพียงแค่ตอบไปแบบขอไปที
เทียบกับรุ่นก่อนหน้าและคู่แข่ง
เมื่อเทียบกับ Gemini 1.0 รุ่น 1.5 Pro ไม่ได้เพียงมีบริบทยาวขึ้นเท่านั้น สถาปัตยกรรม MoE เองยังสะท้อนถึงการเปลี่ยนแนวทางด้านประสิทธิภาพการฝึกฝน คือใช้ทรัพยากรการประมวลผลน้อยลงแต่ได้ผลลัพธ์ใกล้เคียงโมเดลเรือธง เมื่อเทียบกับคู่แข่งในช่วงเวลาเดียวกัน GPT-4 Turbo ของ OpenAI มีบริบท 128,000 โทเคน และ Claude 2.1 ของ Anthropic มี 200,000 โทเคน ตัวเลข 1 ล้านโทเคนของ Gemini 1.5 Pro จึงทิ้งห่างหลายเท่าตัวจนถึงเกือบสิบเท่า เท่ากับดึงมาตรฐานปริมาณเนื้อหาที่โมเดลประมวลผลได้ในครั้งเดียวขึ้นไปอีกระดับหนึ่งทันที อย่างไรก็ตาม นี่ยังเป็นเพียงการสาธิตสเปกในขั้นทดลองใช้แบบจำกัด ความเสถียร ความหน่วง และค่าใช้จ่ายเมื่อเปิดใช้งานเต็มรูปแบบยังต้องรอการติดตามต่อไป
ปฏิกิริยาจากวงการ
หลังการเปิดตัว ประเด็นที่ชุมชนนักพัฒนาและสื่อเทคโนโลยีให้ความสนใจ คือบริบทยาวพิเศษจะมาแทนที่สถาปัตยกรรม RAG (Retrieval-Augmented Generation) หรือไม่ หากโมเดลสามารถรับฐานความรู้ทั้งหมดได้โดยตรง ยังจำเป็นต้องทำ vector search หรือทำดัชนีแบบแบ่งส่วนอยู่อีกหรือไม่ ความเห็นส่วนใหญ่มองว่าทั้งสองแนวทางจะอยู่ร่วมกันไปในระยะสั้น บริบทยาวพิเศษเหมาะกับการวิเคราะห์เชิงลึกของเอกสารหรือสื่อขนาดใหญ่ชิ้นเดียว ส่วน RAG ยังเหมาะกับฐานความรู้ที่อัปเดตต่อเนื่องและมีขนาดใหญ่เกินล้านโทเคนมาก สิ่งนี้ทำให้ Gemini 1.5 Pro ถูกมองว่าเป็นหมัดหนักที่ Google ปล่อยใส่ OpenAI และ Anthropic ในสนามการทำความเข้าใจเอกสารยาว
ความหมายต่อผู้บริหาร
สำหรับผู้บริหาร ประเด็นสำคัญของข่าวนี้ไม่ได้อยู่ที่สถาปัตยกรรมทางเทคนิค แต่อยู่ที่ความเป็นไปได้ที่จับต้องได้ นั่นคือในอนาคตการนำสัญญาประจำปีทั้งฉบับ วิดีโอประชุมคณะกรรมการทั้งงาน หรือระเบียบภายในทั้งชุด ไปให้ AI อ่านจบในครั้งเดียวแล้วตอบคำถามได้ทันที โดยไม่ต้องสรุปย่อล่วงหน้า ในทางทฤษฎีเริ่มเป็นไปได้แล้ว องค์กรที่จะนำมาใช้ยังต้องพิจารณาความเสถียรในช่วงทดลองใช้และประเด็นด้านความปลอดภัยของข้อมูล แต่นี่หมายความว่างานที่ใช้เวลามาก เช่น การตรวจเอกสาร หรือ การสรุปบันทึกการประชุม มีโอกาสถูกย่นระยะเวลาลงอย่างมากในอนาคต
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี