Gemini 3.8 Live 長出一張臉:Live Avatar 即時影像化身在 Gemini Enterprise 正式 GA
Google 於 2026/9/24 宣布 Gemini 3.8 Live 新增 Live Avatar 即時影像化身,並在 Gemini Enterprise 正式 GA:97 種語言對嘴、自然表情、對話中背景呼叫工具,自訂化身需白名單審核,影音全數嵌入 SynthID,定位客服與互動式導覽。
2026 年 9 月 24 日,Google 透過 blog.google 與 Google Cloud Blog 同步宣布:Gemini 3.8 Live 新增「Live Avatar」即時影像化身能力,並在 Gemini Enterprise 正式 GA(一般可用)。要先說清楚,Gemini 3.8 Live 這個即時語音模型已在 9 月 15 日另行發表,這次不是模型換代,而是讓它多了一張「會說話的臉」。
依官方公告,這次的重點規格如下:
- 精準對嘴:支援 97 種語言,化身口型與語音同步。
- 自然表情:化身在對話中呈現自然的臉部表情,不是固定頭像。
- 背景呼叫工具:對話進行中,模型可在背景呼叫工具。
- 兩種化身來源:內建化身庫可直接部署;自訂化身須經企業白名單審核。
- SynthID 浮水印:所有生成的影像與聲音都嵌入 SynthID。
- 企業部署條件:提供 US/EU 端點、provisioned throughput(預留吞吐量)與企業合規配套。
官方把用途定位在客服與互動式導覽;價格與具名導入客戶,公告中都沒有公布。
技術意義:從「聽得懂」走到「看得見」
即時語音代理已經能做到低延遲對話,但真人服務的體驗還包括表情與口型。Live Avatar 把語音、影像生成與工具呼叫放進同一個即時流程:顧客說話,化身一邊回應、一邊在背景查資料。97 種語言的對嘴能力,代表同一個化身可以切換語言服務不同客群,不需要為每種語言另外錄製影片。
管控設計:白名單與浮水印先行
數位人最大的爭議是深偽。Google 這次設了兩道閘:自訂化身必須通過企業白名單審核,降低拿真人肖像任意生成的風險;所有輸出影音都嵌入 SynthID,事後可辨識為 AI 生成。再加上 US/EU 端點與預留吞吐量,瞄準的明顯是對資料落地與服務穩定度有要求的企業客戶,而非消費級玩具。
與過去做法相比
過去做數位人客服,多半要自行串接語音、影像與對嘴模組;如今以單一平台 GA 提供,整合門檻降低。但價格未公布,現在就斷言「比真人客服便宜」還言之過早。
對管理者的意義:對經營客服中心、飯店櫃台或門市導覽的管理者來說,這則新聞的啟示不是「馬上換掉真人」,而是多語接待的門檻正在下降。導入前應先想清楚三件事:哪些問題適合交給化身處理、化身背後能呼叫哪些系統資料、以及如何主動告知顧客對方是 AI(SynthID 是技術標記,不等於已向顧客揭露)。較穩妥的起步,是先用內建化身庫做常見問題導覽的小範圍試點,再評估是否申請自訂化身。