คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 78/303 ตอน ดูสารบัญคอร์ส

Google เปิดตัว Gemini 2.0 Flash: ประกาศทางการก้าวสู่ยุค "Agentic AI"

11/12/2024 307
≈3:43
Google เปิดตัว Gemini 2.0 Flash: ประกาศทางการก้าวสู่ยุค "Agentic AI"
ภาพ/Photo by Homa Appliances on Unsplash

Google DeepMind เปิดตัวโมเดลแรกในตระกูล Gemini 2.0 คือ Gemini 2.0 Flash เมื่อวันที่ 11 ธันวาคม พ.ศ. 2567 ชูจุดเด่นการโต้ตอบแบบมัลติโมดัลเรียลไทม์ การสร้างภาพในตัว และการเชื่อมต่อการค้นหา โดยระบุว่าเป็นจุดเริ่มต้นของยุค Agentic AI

วันที่ 11 ธันวาคม พ.ศ. 2567 Google DeepMind ประกาศเปิดตัวโมเดลแรกในตระกูล Gemini 2.0 อย่างเป็นทางการ คือ "Gemini 2.0 Flash" บล็อกทางการของ Google ระบุชัดเจนว่านี่คือจุดเริ่มต้นของ "ยุค Agentic AI" กล่าวคือบทบาทของ AI กำลังเปลี่ยนจาก "ผู้ช่วยที่ตอบคำถามทีละรอบ" ไปสู่ "ตัวแทนที่วางแผนและดำเนินงานหลายขั้นตอนได้เอง" ขณะนี้เปิดให้เฉพาะนักพัฒนาและผู้ทดสอบที่ได้รับความไว้วางใจ โดย Google ระบุว่าจะเปิดกว้างขึ้นช่วงต้นปี พ.ศ. 2568 ถือเป็นระยะพรีวิวทางเทคนิค

4 คุณสมบัติหลัก

ประกาศทางการเผยความสามารถสำคัญ 4 ข้อ: หนึ่ง "Multimodal Live API" รองรับเสียงและวิดีโอแบบเรียลไทม์ ทำให้โมเดลดู ฟัง และตอบสนองพร้อมกันได้เหมือนวิดีโอคอล แทนรูปแบบ "พิมพ์คำถาม รอคำตอบ" เดิม สอง ความสามารถสร้างภาพในตัวโมเดลโดยตรง สาม ระบบแปลงข้อความเป็นเสียงที่ควบคุมได้ พร้อมลายน้ำเพื่อตรวจสอบเนื้อหาที่มาจาก AI ในภายหลัง สี่ การเชื่อมต่อ Google Search ให้โมเดลดึงข้อมูลอินเทอร์เน็ตแบบเรียลไทม์มาตอบ แทนที่จะพึ่งความรู้ตายตัวจากการฝึกฝนเท่านั้น

ความหมายเชิงเทคนิค: จาก "ตอบคำถาม" สู่ "ลงมือทำ"

เมื่อมองทั้ง 4 ฟีเจอร์ร่วมกัน สิ่งที่ Google สื่อสารไม่ใช่ฟีเจอร์ไหนเจ๋งที่สุด แต่คือการรวมกันหมายถึงอะไร: การโต้ตอบวิดีโอ-เสียงเรียลไทม์+สร้างภาพในตัว+ค้นหาเรียลไทม์+ตอบด้วยเสียง เท่ากับโมเดลหนึ่งตัวมีวงจรครบ "มองเห็น เข้าใจบริบท สร้างเนื้อหา ตอบด้วยเสียง ตรวจสอบข้อเท็จจริง" นี่คือโครงสร้างพื้นฐานของ Agentic AI เพราะ AI ต้องรับรู้ ตัดสินใจ ลงมือทำต่อเนื่องแบบมนุษย์ก่อน จึงจะทำงานได้เองอย่างสมบูรณ์ นี่จึงอธิบายว่าทำไม Google ใช้คำว่า "ยุค" แทน "อัปเดต"

เทียบกับรุ่นก่อนและวงการ

เมื่อเทียบรุ่นก่อนที่เน้นความแม่นยำในการตอบและการให้เหตุผล Gemini 2.0 Flash ครั้งนี้ให้น้ำหนักกับ "รูปแบบการโต้ตอบ" และ "การลงมือทำ" มากขึ้น สอดคล้องทิศทางอุตสาหกรรมช่วงครึ่งหลังปี พ.ศ. 2567 ที่หลายค่ายเพิ่มเสียงเรียลไทม์ ควบคุมหน้าจอ และค้นหาเว็บ แสดงว่า "การโต้ตอบมัลติโมดัลเรียลไทม์" และ "การดำเนินงานอัตโนมัติ" กำลังเป็นทิศทางร่วมของค่าย AI รายใหญ่ ไม่ใช่กลยุทธ์ฝ่ายเดียวของ Google การเปิดเฉพาะนักพัฒนาก่อนก็สอดคล้องธรรมเนียมวงการที่ทดสอบในวงจำกัดก่อนขยายผล

ความหมายต่อผู้บริหาร

สิ่งที่ควรให้ความสำคัญไม่ใช่ "Gemini ออกเวอร์ชันใหม่" แต่คือทิศทางที่ "การโต้ตอบมัลติโมดัลเรียลไทม์ + การลงมือทำอัตโนมัติ" กำลังเป็นมาตรฐานของผลิตภัณฑ์ AI เมื่อ AI ดูภาพ ฟังเสียง ค้นหาข้อมูล และสร้างเนื้อหาพร้อมตอบด้วยเสียงได้พร้อมกัน งานที่ต้องการ "การโต้ตอบต่อเนื่อง" เช่น การตอบลูกค้า การฝึกอบรม หรือการนำเสนอสินค้า มีโอกาสถูกออกแบบใหม่ ขณะนี้ยังอยู่ระยะทดสอบจำกัด ยังไม่จำเป็นต้องรีบนำมาใช้ แต่ควรเริ่มสังเกตว่าหลังเปิดใช้งานเต็มรูปแบบต้นปี พ.ศ. 2568 งานส่วนใดของทีมที่ "หลายขั้นตอนและต้องตัดสินใจแบบเรียลไทม์" มีแนวโน้มจะถูก Agentic AI เข้ามาก่อน

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร OpenAI เผยโฉมโมเดลให้เหตุผลรุ่นใหม่ o3/o3-mini ทำคะแนน AIME สูงถึง 96.7%

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว