專欄 AI 管理編年史 第 291/303 講 查看課程目錄

Gemini 3.8 Live 長出一張臉:Live Avatar 即時影像化身在 Gemini Enterprise 正式 GA

24/09/2026 151
3:53
Gemini 3.8 Live 長出一張臉:Live Avatar 即時影像化身在 Gemini Enterprise 正式 GA
圖/Photo by Buddha Elemental 3D on Unsplash

Google 於 2026/9/24 宣布 Gemini 3.8 Live 新增 Live Avatar 即時影像化身,並在 Gemini Enterprise 正式 GA:97 種語言對嘴、自然表情、對話中背景呼叫工具,自訂化身需白名單審核,影音全數嵌入 SynthID,定位客服與互動式導覽。

2026 年 9 月 24 日,Google 透過 blog.google 與 Google Cloud Blog 同步宣布:Gemini 3.8 Live 新增「Live Avatar」即時影像化身能力,並在 Gemini Enterprise 正式 GA(一般可用)。要先說清楚,Gemini 3.8 Live 這個即時語音模型已在 9 月 15 日另行發表,這次不是模型換代,而是讓它多了一張「會說話的臉」。

依官方公告,這次的重點規格如下:

  • 精準對嘴:支援 97 種語言,化身口型與語音同步。
  • 自然表情:化身在對話中呈現自然的臉部表情,不是固定頭像。
  • 背景呼叫工具:對話進行中,模型可在背景呼叫工具。
  • 兩種化身來源:內建化身庫可直接部署;自訂化身須經企業白名單審核。
  • SynthID 浮水印:所有生成的影像與聲音都嵌入 SynthID。
  • 企業部署條件:提供 US/EU 端點、provisioned throughput(預留吞吐量)與企業合規配套。

官方把用途定位在客服與互動式導覽;價格與具名導入客戶,公告中都沒有公布。

技術意義:從「聽得懂」走到「看得見」

即時語音代理已經能做到低延遲對話,但真人服務的體驗還包括表情與口型。Live Avatar 把語音、影像生成與工具呼叫放進同一個即時流程:顧客說話,化身一邊回應、一邊在背景查資料。97 種語言的對嘴能力,代表同一個化身可以切換語言服務不同客群,不需要為每種語言另外錄製影片。

管控設計:白名單與浮水印先行

數位人最大的爭議是深偽。Google 這次設了兩道閘:自訂化身必須通過企業白名單審核,降低拿真人肖像任意生成的風險;所有輸出影音都嵌入 SynthID,事後可辨識為 AI 生成。再加上 US/EU 端點與預留吞吐量,瞄準的明顯是對資料落地與服務穩定度有要求的企業客戶,而非消費級玩具。

與過去做法相比

過去做數位人客服,多半要自行串接語音、影像與對嘴模組;如今以單一平台 GA 提供,整合門檻降低。但價格未公布,現在就斷言「比真人客服便宜」還言之過早。

對管理者的意義:對經營客服中心、飯店櫃台或門市導覽的管理者來說,這則新聞的啟示不是「馬上換掉真人」,而是多語接待的門檻正在下降。導入前應先想清楚三件事:哪些問題適合交給化身處理、化身背後能呼叫哪些系統資料、以及如何主動告知顧客對方是 AI(SynthID 是技術標記,不等於已向顧客揭露)。較穩妥的起步,是先用內建化身庫做常見問題導覽的小範圍試點,再評估是否申請自訂化身。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 NVIDIA 推出開放代理安全平台:OpenShell 開源執行邊界+Sentry 硬體監看

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策