专栏 AI 管理编年史 第 291/303 讲 查看课程目录

Gemini 3.8 Live 长出一张脸:Live Avatar 实时视频数字人在 Gemini Enterprise 正式 GA

24/09/2026 153
3:53
Gemini 3.8 Live 长出一张脸:Live Avatar 实时视频数字人在 Gemini Enterprise 正式 GA
图/Photo by Buddha Elemental 3D on Unsplash

Google 于 2026/9/24 宣布 Gemini 3.8 Live 新增 Live Avatar 实时视频数字人,并在 Gemini Enterprise 正式 GA:97 种语言口型同步、自然表情、对话中后台调用工具,自定义数字人需白名单审核,音视频全部嵌入 SynthID,定位客服与互动式导览。

2026 年 9 月 24 日,Google 通过 blog.google 与 Google Cloud Blog 同步宣布:Gemini 3.8 Live 新增「Live Avatar」实时视频数字人能力,并在 Gemini Enterprise 正式 GA(全面可用)。需要先说明,Gemini 3.8 Live 这个实时语音模型已在 9 月 15 日另行发布,这次不是模型换代,而是让它多了一张「会说话的脸」。

根据官方公告,这次的重点规格如下:

  • 精准口型同步:支持 97 种语言,数字人口型与语音同步。
  • 自然表情:数字人在对话中呈现自然的面部表情,而非固定头像。
  • 后台调用工具:对话进行中,模型可在后台调用工具。
  • 两种数字人来源:内置形象库可直接部署;自定义形象须经企业白名单审核。
  • SynthID 水印:所有生成的视频与音频都嵌入 SynthID。
  • 企业部署条件:提供 US/EU 端点、provisioned throughput(预留吞吐量)与企业合规配套。

官方将用途定位于客服与互动式导览;价格与具名落地客户,公告中均未公布。

技术意义:从「听得懂」走到「看得见」

实时语音智能体已经能实现低延迟对话,但真人服务的体验还包括表情与口型。Live Avatar 把语音、视频生成与工具调用放进同一个实时流程:顾客说话,数字人一边回应、一边在后台查数据。97 种语言的口型同步能力,意味着同一个数字人可以切换语言服务不同客群,无需为每种语言另外录制视频。

管控设计:白名单与水印先行

数字人最大的争议是深度伪造。Google 这次设了两道闸:自定义形象必须通过企业白名单审核,降低拿真人肖像随意生成的风险;所有输出音视频都嵌入 SynthID,事后可识别为 AI 生成。再加上 US/EU 端点与预留吞吐量,瞄准的显然是对数据本地化与服务稳定性有要求的企业客户,而非消费级玩具。

与以往做法相比

过去做数字人客服,多半要自行对接语音、视频与口型驱动模块;如今以单一平台 GA 提供,集成门槛降低。但价格未公布,现在就断言「比真人客服便宜」还为时过早。

对管理者的意义:对运营客服中心、酒店前台或门店导览的管理者来说,这则新闻的启示不是「马上替换真人」,而是多语种接待的门槛正在下降。引入前应先想清楚三件事:哪些问题适合交给数字人处理、数字人背后能调用哪些系统数据、以及如何主动告知顾客对方是 AI(SynthID 是技术标记,不等于已向顾客披露)。较稳妥的起步,是先用内置形象库做常见问题导览的小范围试点,再评估是否申请自定义形象。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 NVIDIA 推出开放智能体安全平台:OpenShell 开源执行边界+Sentry 硬件监控

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策