Gemini 3.8 Live มีใบหน้าแล้ว: Live Avatar อวตารวิดีโอแบบเรียลไทม์เปิดใช้งานทั่วไป (GA) บน Gemini Enterprise
Google ประกาศเมื่อ 24 ก.ย. 2569 เพิ่มความสามารถ Live Avatar ให้ Gemini 3.8 Live และเปิดใช้งานทั่วไป (GA) บน Gemini Enterprise: ขยับปากตรงเสียง 97 ภาษา สีหน้าเป็นธรรมชาติ เรียกใช้เครื่องมือเบื้องหลังระหว่างสนทนา อวตารแบบกำหนดเองต้องผ่านการอนุมัติ whitelist ภาพและเสียงฝัง SynthID ทั้งหมด เน้นงานบริการลูกค้าและการนำชมแบบโต้ตอบ
เมื่อวันที่ 24 กันยายน 2569 Google ประกาศผ่าน blog.google และ Google Cloud Blog พร้อมกันว่า Gemini 3.8 Live ได้เพิ่มความสามารถ "Live Avatar" หรืออวตารวิดีโอแบบเรียลไทม์ และเปิดให้ใช้งานทั่วไป (GA) บน Gemini Enterprise แล้ว ต้องขอชี้แจงก่อนว่า โมเดลเสียงเรียลไทม์ Gemini 3.8 Live เปิดตัวไปแล้วเมื่อวันที่ 15 กันยายน ครั้งนี้จึงไม่ใช่การเปลี่ยนรุ่นโมเดล แต่เป็นการเพิ่ม "ใบหน้าที่พูดได้" ให้กับโมเดลเดิม
ตามประกาศอย่างเป็นทางการ สเปกสำคัญมีดังนี้:
- ขยับปากตรงเสียงอย่างแม่นยำ: รองรับ 97 ภาษา ปากของอวตารสอดคล้องกับเสียงพูด
- สีหน้าเป็นธรรมชาติ: อวตารแสดงสีหน้าอย่างเป็นธรรมชาติระหว่างสนทนา ไม่ใช่ภาพนิ่ง
- เรียกใช้เครื่องมือเบื้องหลัง: ระหว่างสนทนา โมเดลสามารถเรียกใช้เครื่องมือในเบื้องหลังได้
- อวตารสองแหล่ง: คลังอวตารสำเร็จรูปนำไปใช้งานได้ทันที ส่วนอวตารแบบกำหนดเองต้องผ่านการอนุมัติ whitelist ขององค์กร
- ลายน้ำ SynthID: ภาพและเสียงที่สร้างขึ้นทั้งหมดฝัง SynthID
- เงื่อนไขสำหรับองค์กร: มี endpoint ในสหรัฐฯ และสหภาพยุโรป, provisioned throughput (ความจุประมวลผลแบบจองล่วงหน้า) และมาตรการด้านการปฏิบัติตามกฎระเบียบสำหรับองค์กร
Google วางตำแหน่งการใช้งานไว้ที่งานบริการลูกค้าและการนำชมแบบโต้ตอบ ทั้งนี้ประกาศไม่ได้เปิดเผยราคาและรายชื่อลูกค้าที่นำไปใช้
ความหมายเชิงเทคนิค: จาก "ฟังเข้าใจ" สู่ "มองเห็นได้"
เอเจนต์เสียงแบบเรียลไทม์สนทนาได้โดยมีความหน่วงต่ำอยู่แล้ว แต่ประสบการณ์บริการแบบคนจริงยังรวมถึงสีหน้าและการขยับปาก Live Avatar นำเสียง การสร้างวิดีโอ และการเรียกใช้เครื่องมือมารวมไว้ในกระบวนการเรียลไทม์เดียวกัน: ลูกค้าพูด อวตารตอบพร้อมค้นข้อมูลในเบื้องหลัง ความสามารถขยับปาก 97 ภาษา หมายความว่าอวตารตัวเดียวสลับภาษาให้บริการลูกค้าหลายกลุ่มได้ โดยไม่ต้องถ่ายวิดีโอแยกแต่ละภาษา
การออกแบบด้านการควบคุม: whitelist และลายน้ำมาก่อน
ข้อถกเถียงใหญ่ที่สุดของมนุษย์ดิจิทัลคือ deepfake ครั้งนี้ Google วางด่านไว้สองชั้น: อวตารแบบกำหนดเองต้องผ่านการอนุมัติ whitelist ขององค์กร เพื่อลดความเสี่ยงจากการนำภาพบุคคลจริงไปสร้างโดยพลการ และภาพเสียงทั้งหมดฝัง SynthID เพื่อให้ตรวจสอบย้อนหลังได้ว่าสร้างโดย AI เมื่อรวมกับ endpoint สหรัฐฯ/สหภาพยุโรปและความจุแบบจองล่วงหน้า เป้าหมายชัดเจนว่าคือลูกค้าองค์กรที่ให้ความสำคัญกับถิ่นที่ตั้งของข้อมูลและเสถียรภาพของบริการ ไม่ใช่ของเล่นสำหรับผู้บริโภค
เทียบกับวิธีการแบบเดิม
ที่ผ่านมา องค์กรที่ต้องการทำพนักงานบริการแบบมนุษย์ดิจิทัล มักต้องเชื่อมโมเดลเสียง การสร้างวิดีโอ และโมดูลขยับปากเข้าด้วยกันเอง ปัจจุบัน Live Avatar ให้บริการในรูปแบบแพลตฟอร์มเดียวที่เปิดใช้งานทั่วไป จึงช่วยลดความยุ่งยากในการเชื่อมระบบ อย่างไรก็ตาม Google ยังไม่ประกาศราคา การสรุปตอนนี้ว่า "ถูกกว่าพนักงานจริง" จึงยังเร็วเกินไป
ความหมายต่อผู้บริหาร: สำหรับผู้บริหารศูนย์บริการลูกค้า เคาน์เตอร์โรงแรม หรือการนำชมในร้านค้า ข่าวนี้ไม่ได้บอกให้ "เปลี่ยนพนักงานทันที" แต่ชี้ว่าอุปสรรคในการต้อนรับลูกค้าหลายภาษากำลังลดลง ก่อนนำมาใช้ควรคิดให้ชัดสามเรื่อง ได้แก่ คำถามแบบใดเหมาะให้อวตารรับผิดชอบ อวตารเรียกใช้ข้อมูลจากระบบใดได้บ้าง และจะแจ้งลูกค้าอย่างไรว่กำลังคุยกับ AI (SynthID เป็นเครื่องหมายทางเทคนิค ไม่เท่ากับการแจ้งลูกค้าแล้ว) จุดเริ่มต้นที่รอบคอบคือนำร่องในวงแคบด้วยคลังอวตารสำเร็จรูปสำหรับการนำชมตอบคำถามที่พบบ่อย แล้วจึงประเมินว่าจะขออวตารแบบกำหนดเองหรือไม่
สมาชิกฟรีทำแบบทดสอบ คุยกับโค้ช AI ฟังบทความสะสมประวัติการเรียนรู้ สมัครรับ 100 พอยต์ทันที
สมัครฟรี