Google เปิดตัวโมเดลทดลอง Gemini-exp-1114 ขึ้นอันดับ 1 ร่วมบน LMArena จากการโหวตของชุมชน
Google DeepMind เปิดตัวโมเดลทดลอง Gemini-exp-1114 เมื่อ 14 พ.ย. เปิดให้นักพัฒนาทดสอบใน Google AI Studio ก่อน หลังได้รับโหวตจากชุมชนกว่า 6,000 ครั้งบน LMArena โมเดลนี้ขึ้นอันดับ 1 ร่วมในตารางรวม เทียบเท่า GPT-4o-latest และแซง o1-preview พร้อมครองอันดับ 1 ด้านความเข้าใจภาพ แต่นักวิเคราะห์บางส่วนชี้ว่าหากตัดปัจจัยด้านสไตล์การตอบออก อันดับจะร่วงไปอยู่ที่ 4
เมื่อวันที่ 14 พฤศจิกายน พ.ศ. 2567 Google DeepMind ได้เปิดตัวโมเดลทดลองในชื่อรหัส Gemini-exp-1114 โดยยังไม่ได้ปล่อยเข้าสู่ Gemini App หรือเว็บไซต์หลักที่ผู้ใช้ทั่วไปคุ้นเคย แต่เปิดให้ทดสอบก่อนใน Google AI Studio เพื่อให้ชุมชนนักพัฒนาได้ลองใช้และเก็บฟีดแบ็ก ซึ่งเป็นรูปแบบการเปิดตัวแบบ “ทดลองก่อน ค่อยเป็นทางการทีหลัง” ที่พบได้บ่อย
สิ่งที่ทำให้ข่าวนี้ได้รับความสนใจคือผลงานบน LMArena (เดิมชื่อ Chatbot Arena) ซึ่งเป็นระบบจัดอันดับโมเดลที่ขับเคลื่อนด้วยการโหวตของชุมชน โดยผู้ใช้จะเห็นคำตอบจากโมเดลนิรนามสองตัวพร้อมกัน แล้วเลือกคำตอบที่ดีกว่า เมื่อสะสมคะแนนโหวตแล้วจะแปลงเป็นคะแนนอันดับ หลังจากได้รับโหวตกว่า 6,000 ครั้ง Gemini-exp-1114 ขึ้นสู่อันดับ 1 ร่วมในตารางคะแนนรวม เทียบเท่ากับ GPT-4o-latest และแซงหน้า o1-preview ของ OpenAI ที่เปิดตัวก่อนหน้านี้และโดดเด่นด้านการให้เหตุผลเชิงลึก นอกจากตารางรวมแล้ว โมเดลนี้ยังครองอันดับ 1 เดี่ยวในหมวด “ความเข้าใจภาพ” และขึ้นไปอยู่อันดับ 1 ในหมวดคณิตศาสตร์ คำสั่งที่ยากซับซ้อน และงานเขียนเชิงสร้างสรรค์ด้วยเช่นกัน
ความหมายเชิงเทคนิค: การก้าวกระโดดรอบด้าน ไม่ใช่จุดเดียว
สิ่งที่น่าสังเกตคือความก้าวหน้าของ Gemini-exp-1114 ไม่ได้กระจุกตัวอยู่ที่ความสามารถเดียว แต่ขึ้นอันดับต้น ๆ พร้อมกันในหลายด้าน ทั้งความเข้าใจภาพ การให้เหตุผลทางคณิตศาสตร์ งานเขียนเชิงสร้างสรรค์ และการทำตามคำสั่งที่ซับซ้อน รูปแบบ “ก้าวหน้าพร้อมกันหลายด้าน” เช่นนี้ มักบ่งชี้ว่าโครงสร้างพื้นฐานของโมเดลหรือชุดข้อมูลฝึกฝนได้รับการยกระดับในภาพรวม มากกว่าการปรับแต่งเฉพาะจุดเพื่อเอาชนะการทดสอบใดการทดสอบหนึ่ง สำหรับนักพัฒนา นี่หมายความว่าการเรียกใช้โมเดลตัวเดียวในอนาคตอาจตอบโจทย์ทั้งงานที่ต้องเข้าใจภาพและงานสร้างข้อความไปพร้อมกัน ลดต้นทุนในการสลับใช้โมเดลหลายตัวสำหรับงานต่างประเภท
เทียบกับคู่แข่ง: ท้าชน GPT-4o และ o1-preview โดยตรง
การเทียบเท่า GPT-4o-latest และแซงหน้า o1-preview คือสัญญาณการแข่งขันที่ชัดเจนที่สุดจากการเปิดตัวครั้งนี้ o1-preview เป็นตระกูลโมเดลที่ OpenAI ชูจุดเด่นด้าน “การให้เหตุผลเชิงลึก” และเคยถูกมองเป็นมาตรฐานอ้างอิงในงานตรรกะซับซ้อน การที่ Gemini-exp-1114 สามารถแซงหน้าในตารางรวมได้ สะท้อนว่า Google กำลังไล่ตามอย่างรวดเร็วในงานด้านการให้เหตุผล และอาจนำหน้าในบางมิติแล้ว สอดคล้องกับภาพรวมการแข่งขันในช่วงครึ่งหลังของปี พ.ศ. 2567 ที่ OpenAI, Google, Anthropic และ xAI ต่างเร่งปล่อยโมเดลใหม่หรือเวอร์ชันอัปเกรดแทบทุกเดือน
ปฏิกิริยาในวงการ: ความน่าเชื่อถือของตารางคะแนนถูกตั้งคำถามอีกครั้ง
อย่างไรก็ตาม การเปิดตัวครั้งนี้ก็มาพร้อมเสียงวิพากษ์วิจารณ์ที่ระมัดระวังเช่นกัน มีการวิเคราะห์ชี้ว่าอันดับบน LMArena มีแนวโน้มได้รับอิทธิพลจาก “สไตล์การตอบ” เช่น น้ำเสียงที่ถูกใจผู้ใช้มากกว่า รูปแบบการจัดวางที่เป็นระเบียบกว่า หรือคำตอบที่ยาวกว่า แม้เนื้อหาเชิงลึกอาจไม่ได้ดีกว่าจริง ก็ยังอาจได้เปรียบในการโหวตของมนุษย์ หากตัดปัจจัยด้านสไตล์ออกแล้วพิจารณาเฉพาะคุณภาพเนื้อหาจริง อันดับของ Gemini-exp-1114 จะร่วงจากอันดับ 1 ร่วมไปอยู่ที่อันดับ 4 ซึ่งเป็นการเตือนผู้ใช้และผู้บริหารองค์กรว่าตารางคะแนนจากการโหวตของชุมชนเป็นข้อมูลอ้างอิงที่มีประโยชน์ แต่ไม่เท่ากับการทดสอบมาตรฐานความสามารถที่เข้มงวด จึงควรตีความอย่างระมัดระวัง
สำหรับผู้บริหาร ประเด็นสำคัญของข่าวนี้ไม่ใช่ “ควรเปลี่ยนไปใช้โมเดลนี้ทันทีหรือไม่” แต่เป็นการเตือนทีมงานว่าอันดับความสามารถของโมเดล AI เปลี่ยนแปลงเร็วมาก และวิธีการประเมินผลเองก็มีข้อจำกัด แทนที่จะไล่ตามคะแนนจากตารางเดียว ควรทดลองใช้โมเดลใหม่กับสถานการณ์ธุรกิจจริงของตนเองเป็นระยะ เช่น บทสนทนากับลูกค้าจริงหรือรูปภาพสินค้าจริง แล้วตัดสินใจจากผลลัพธ์จริงมากกว่าอันดับบนตาราง
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี