คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 71/303 ตอน ดูสารบัญคอร์ส

Google เปิดตัวโมเดลทดลอง Gemini-exp-1114 ขึ้นอันดับ 1 ร่วมบน LMArena จากการโหวตของชุมชน

14/11/2024 245
5:10
Google เปิดตัวโมเดลทดลอง Gemini-exp-1114 ขึ้นอันดับ 1 ร่วมบน LMArena จากการโหวตของชุมชน
ภาพ/Photo by Jonathan Kemper on Unsplash

Google DeepMind เปิดตัวโมเดลทดลอง Gemini-exp-1114 เมื่อ 14 พ.ย. เปิดให้นักพัฒนาทดสอบใน Google AI Studio ก่อน หลังได้รับโหวตจากชุมชนกว่า 6,000 ครั้งบน LMArena โมเดลนี้ขึ้นอันดับ 1 ร่วมในตารางรวม เทียบเท่า GPT-4o-latest และแซง o1-preview พร้อมครองอันดับ 1 ด้านความเข้าใจภาพ แต่นักวิเคราะห์บางส่วนชี้ว่าหากตัดปัจจัยด้านสไตล์การตอบออก อันดับจะร่วงไปอยู่ที่ 4

เมื่อวันที่ 14 พฤศจิกายน พ.ศ. 2567 Google DeepMind ได้เปิดตัวโมเดลทดลองในชื่อรหัส Gemini-exp-1114 โดยยังไม่ได้ปล่อยเข้าสู่ Gemini App หรือเว็บไซต์หลักที่ผู้ใช้ทั่วไปคุ้นเคย แต่เปิดให้ทดสอบก่อนใน Google AI Studio เพื่อให้ชุมชนนักพัฒนาได้ลองใช้และเก็บฟีดแบ็ก ซึ่งเป็นรูปแบบการเปิดตัวแบบ “ทดลองก่อน ค่อยเป็นทางการทีหลัง” ที่พบได้บ่อย

สิ่งที่ทำให้ข่าวนี้ได้รับความสนใจคือผลงานบน LMArena (เดิมชื่อ Chatbot Arena) ซึ่งเป็นระบบจัดอันดับโมเดลที่ขับเคลื่อนด้วยการโหวตของชุมชน โดยผู้ใช้จะเห็นคำตอบจากโมเดลนิรนามสองตัวพร้อมกัน แล้วเลือกคำตอบที่ดีกว่า เมื่อสะสมคะแนนโหวตแล้วจะแปลงเป็นคะแนนอันดับ หลังจากได้รับโหวตกว่า 6,000 ครั้ง Gemini-exp-1114 ขึ้นสู่อันดับ 1 ร่วมในตารางคะแนนรวม เทียบเท่ากับ GPT-4o-latest และแซงหน้า o1-preview ของ OpenAI ที่เปิดตัวก่อนหน้านี้และโดดเด่นด้านการให้เหตุผลเชิงลึก นอกจากตารางรวมแล้ว โมเดลนี้ยังครองอันดับ 1 เดี่ยวในหมวด “ความเข้าใจภาพ” และขึ้นไปอยู่อันดับ 1 ในหมวดคณิตศาสตร์ คำสั่งที่ยากซับซ้อน และงานเขียนเชิงสร้างสรรค์ด้วยเช่นกัน

ความหมายเชิงเทคนิค: การก้าวกระโดดรอบด้าน ไม่ใช่จุดเดียว

สิ่งที่น่าสังเกตคือความก้าวหน้าของ Gemini-exp-1114 ไม่ได้กระจุกตัวอยู่ที่ความสามารถเดียว แต่ขึ้นอันดับต้น ๆ พร้อมกันในหลายด้าน ทั้งความเข้าใจภาพ การให้เหตุผลทางคณิตศาสตร์ งานเขียนเชิงสร้างสรรค์ และการทำตามคำสั่งที่ซับซ้อน รูปแบบ “ก้าวหน้าพร้อมกันหลายด้าน” เช่นนี้ มักบ่งชี้ว่าโครงสร้างพื้นฐานของโมเดลหรือชุดข้อมูลฝึกฝนได้รับการยกระดับในภาพรวม มากกว่าการปรับแต่งเฉพาะจุดเพื่อเอาชนะการทดสอบใดการทดสอบหนึ่ง สำหรับนักพัฒนา นี่หมายความว่าการเรียกใช้โมเดลตัวเดียวในอนาคตอาจตอบโจทย์ทั้งงานที่ต้องเข้าใจภาพและงานสร้างข้อความไปพร้อมกัน ลดต้นทุนในการสลับใช้โมเดลหลายตัวสำหรับงานต่างประเภท

เทียบกับคู่แข่ง: ท้าชน GPT-4o และ o1-preview โดยตรง

การเทียบเท่า GPT-4o-latest และแซงหน้า o1-preview คือสัญญาณการแข่งขันที่ชัดเจนที่สุดจากการเปิดตัวครั้งนี้ o1-preview เป็นตระกูลโมเดลที่ OpenAI ชูจุดเด่นด้าน “การให้เหตุผลเชิงลึก” และเคยถูกมองเป็นมาตรฐานอ้างอิงในงานตรรกะซับซ้อน การที่ Gemini-exp-1114 สามารถแซงหน้าในตารางรวมได้ สะท้อนว่า Google กำลังไล่ตามอย่างรวดเร็วในงานด้านการให้เหตุผล และอาจนำหน้าในบางมิติแล้ว สอดคล้องกับภาพรวมการแข่งขันในช่วงครึ่งหลังของปี พ.ศ. 2567 ที่ OpenAI, Google, Anthropic และ xAI ต่างเร่งปล่อยโมเดลใหม่หรือเวอร์ชันอัปเกรดแทบทุกเดือน

ปฏิกิริยาในวงการ: ความน่าเชื่อถือของตารางคะแนนถูกตั้งคำถามอีกครั้ง

อย่างไรก็ตาม การเปิดตัวครั้งนี้ก็มาพร้อมเสียงวิพากษ์วิจารณ์ที่ระมัดระวังเช่นกัน มีการวิเคราะห์ชี้ว่าอันดับบน LMArena มีแนวโน้มได้รับอิทธิพลจาก “สไตล์การตอบ” เช่น น้ำเสียงที่ถูกใจผู้ใช้มากกว่า รูปแบบการจัดวางที่เป็นระเบียบกว่า หรือคำตอบที่ยาวกว่า แม้เนื้อหาเชิงลึกอาจไม่ได้ดีกว่าจริง ก็ยังอาจได้เปรียบในการโหวตของมนุษย์ หากตัดปัจจัยด้านสไตล์ออกแล้วพิจารณาเฉพาะคุณภาพเนื้อหาจริง อันดับของ Gemini-exp-1114 จะร่วงจากอันดับ 1 ร่วมไปอยู่ที่อันดับ 4 ซึ่งเป็นการเตือนผู้ใช้และผู้บริหารองค์กรว่าตารางคะแนนจากการโหวตของชุมชนเป็นข้อมูลอ้างอิงที่มีประโยชน์ แต่ไม่เท่ากับการทดสอบมาตรฐานความสามารถที่เข้มงวด จึงควรตีความอย่างระมัดระวัง

สำหรับผู้บริหาร ประเด็นสำคัญของข่าวนี้ไม่ใช่ “ควรเปลี่ยนไปใช้โมเดลนี้ทันทีหรือไม่” แต่เป็นการเตือนทีมงานว่าอันดับความสามารถของโมเดล AI เปลี่ยนแปลงเร็วมาก และวิธีการประเมินผลเองก็มีข้อจำกัด แทนที่จะไล่ตามคะแนนจากตารางเดียว ควรทดลองใช้โมเดลใหม่กับสถานการณ์ธุรกิจจริงของตนเองเป็นระยะ เช่น บทสนทนากับลูกค้าจริงหรือรูปภาพสินค้าจริง แล้วตัดสินใจจากผลลัพธ์จริงมากกว่าอันดับบนตาราง

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร xAI เพิ่มความสามารถค้นหาเว็บแบบเรียลไทม์ให้ Grok

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว