Google DeepMind เปิดตัว Gemini 3.8 Live อย่างเป็นทางการ: Extended Thinking ขึ้นอันดับหนึ่งเกณฑ์วัดเสียง รุ่นพื้นฐานราคาเพียงหนึ่งในเจ็ดของคู่แข่ง
วันที่ 15 กันยายน พ.ศ. 2569 Google DeepMind เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking โมเดลเสียงแบบ audio-to-audio เรียลไทม์อย่างเป็นทางการ รองรับการสลับภาษาอัตโนมัติ 97 ภาษา เรียกใช้เครื่องมือเบื้องหลัง และรับข้อมูลภาพ Extended Thinking ทำคะแนน Speech-to-Speech Index 82.6 แซง OpenAI และ xAI ส่วนรุ่นพื้นฐาน 3.8 Live มีต้นทุน 0.84 ดอลลาร์ต่อชั่วโมง ราวหนึ่งในเจ็ดของ GPT-Live-1 Astra
วันที่ 15 กันยายน พ.ศ. 2569 Google DeepMind ประกาศให้ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking พร้อมใช้งานทั่วไป (GA) โดยมี model id คือ gemini-3.8-live และ gemini-3.8-live-extended-thinking ทั้งสองเป็นโมเดลเสียงแบบ audio-to-audio เรียลไทม์ โดย 3.8 Live วางตำแหน่งเป็นตัวเลือกเริ่มต้นสำหรับ voice agent ที่เน้นความหน่วงต่ำ เข้าใจภาพ และคุ้มต้นทุน ส่วน Extended Thinking สามารถประมวลผลเชิงเหตุผลเบื้องหลังระหว่างสนทนาเพื่อจัดการงานที่ซับซ้อนสูง นี่คือครั้งแรกที่ Live API ขับเคลื่อนด้วยโมเดลรุ่น 3.8 และห่างจากที่ OpenAI นำ GPT-Live-1 เข้าสู่ API เมื่อ 10 กันยายน พ.ศ. 2569 เพียงห้าวัน
ความสามารถร่วมของทั้งสองโมเดลมีสามประการ:
- ตรวจจับและสลับภาษาอัตโนมัติ 97 ภาษาระหว่างสนทนา โดยไม่ต้องกำหนดล่วงหน้า
- การเรียกใช้เครื่องมือและ API ทำงานเบื้องหลัง บทสนทนาไม่สะดุด
- ประมวลผลข้อมูลภาพได้เกือบเรียลไทม์ พูดคุยพร้อมมองภาพได้
ผลการทดสอบ: Extended Thinking ขึ้นอันดับหนึ่ง
ตามเกณฑ์วัดของบุคคลที่สาม เช่น Artificial Analysis Gemini 3.8 Live Extended Thinking ทำคะแนน Speech-to-Speech Index ได้ 82.6 สูงกว่า OpenAI GPT-Live-1 Astra ที่ 81.5 และ xAI Grok Voice Think Fast 2.0 ที่ 81.3 ในงาน agent τ-Voice ได้ 68.6% นำหน้า GPT-Live-1 ที่ 67.9% และ Grok ที่ 56.5% ส่วน τ³-Banking ได้ 35.1% สูงกว่า GPT-Live-1 ที่ 32.0% นอกจากนี้ โมเดลตระกูล Gemini 3.8 Live ทำคะแนน Big Bench Audio ได้ 97.7% ช่องว่างไม่ได้ห่างมาก แต่ตำแหน่งอันดับหนึ่งในสามค่ายขณะนี้เป็นของ Google อย่างแท้จริง
สงครามราคา: รุ่นพื้นฐานต้นทุนเหลือหนึ่งในเจ็ดของคู่แข่ง
สิ่งที่สร้างความแตกต่างอย่างแท้จริงคือราคา เมื่อคำนวณเป็นเสียงขาเข้าต่อชั่วโมง 3.8 Live อยู่ที่ 0.84 ดอลลาร์ และ Extended Thinking อยู่ที่ 3.50 ดอลลาร์ เทียบกับ Grok Voice Think Fast 2.0 ที่ 4.80 ดอลลาร์ และ GPT-Live-1 Astra ที่ 5.83 ดอลลาร์ กล่าวคือ รุ่นพื้นฐาน 3.8 Live มีต้นทุนราวหนึ่งในเจ็ดของ GPT-Live-1 Astra ส่วน Extended Thinking ที่ครองอันดับหนึ่งแม้จะแพงกว่า แต่ก็ยังอยู่ที่ราวร้อยละ 60 ของ OpenAI และต่ำกว่า xAI ซึ่งหมายความว่าโครงสร้างต้นทุนของงานบริการลูกค้าด้วยเสียง (voice customer service) หรือผู้ช่วยเสียงที่ต้องสนทนานาน ๆ จะถูกคำนวณใหม่
ช่องทาง: เปิดพร้อมกันตั้งแต่ API จนถึง Workspace
นักพัฒนาใช้งานได้ทันทีผ่าน Gemini API และ Google AI Studio ผู้ใช้ทั่วไปเข้าถึงได้ผ่าน Search Live, แอป Gemini Live และ Google Workspace ได้แก่ Docs, Gmail และ Keep ส่วนเวอร์ชันองค์กร Gemini Enterprise อยู่ในขั้น private preview และจะเข้าสู่ Gemini Enterprise for Customer Experience ต่อไป เมื่อเทียบกับ OpenAI ข้อได้เปรียบของ Google อยู่ที่ช่องทาง Workspace และการค้นหาที่มีอยู่แล้ว ทำให้โมเดลเสียงไม่ใช่แค่ API แต่ฝังเข้าไปในเครื่องมือประจำวันโดยตรง
ความหมายสำหรับผู้บริหาร
เกณฑ์ต้นทุนของ voice agent ถูกกดลงอย่างมากภายในสัปดาห์เดียว และการสลับภาษาอัตโนมัติ 97 ภาษามีประโยชน์อย่างยิ่งกับที่ทำงานในไทยที่ใช้ภาษาจีน (ไต้หวัน/จีนแผ่นดินใหญ่) ไทย และอังกฤษปะปนกัน หากหน้าร้าน ฝ่ายบริการลูกค้า หรือสายจองห้องพักของท่านกำลังประเมิน voice AI ข่าวนี้หมายถึงตัวเลือกที่มากขึ้นและราคาที่ต่ำลง ท่านอาจเริ่มจากการใช้ AI Studio ทดลองเชื่อม 3.8 Live กับบทสนทนาบริการลูกค้าที่พบบ่อยที่สุดหนึ่งรูปแบบ สังเกตความหน่วงและการสลับภาษาว่าตรงกับสถานการณ์จริงหรือไม่ ก่อนตัดสินใจลงทุนต่อ
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี