Gemini 3.8 Live 长出一张脸:Live Avatar 实时视频数字人在 Gemini Enterprise 正式 GA
Google 于 2026/9/24 宣布 Gemini 3.8 Live 新增 Live Avatar 实时视频数字人,并在 Gemini Enterprise 正式 GA:97 种语言口型同步、自然表情、对话中后台调用工具,自定义数字人需白名单审核,音视频全部嵌入 SynthID,定位客服与互动式导览。
2026 年 9 月 24 日,Google 通过 blog.google 与 Google Cloud Blog 同步宣布:Gemini 3.8 Live 新增「Live Avatar」实时视频数字人能力,并在 Gemini Enterprise 正式 GA(全面可用)。需要先说明,Gemini 3.8 Live 这个实时语音模型已在 9 月 15 日另行发布,这次不是模型换代,而是让它多了一张「会说话的脸」。
根据官方公告,这次的重点规格如下:
- 精准口型同步:支持 97 种语言,数字人口型与语音同步。
- 自然表情:数字人在对话中呈现自然的面部表情,而非固定头像。
- 后台调用工具:对话进行中,模型可在后台调用工具。
- 两种数字人来源:内置形象库可直接部署;自定义形象须经企业白名单审核。
- SynthID 水印:所有生成的视频与音频都嵌入 SynthID。
- 企业部署条件:提供 US/EU 端点、provisioned throughput(预留吞吐量)与企业合规配套。
官方将用途定位于客服与互动式导览;价格与具名落地客户,公告中均未公布。
技术意义:从「听得懂」走到「看得见」
实时语音智能体已经能实现低延迟对话,但真人服务的体验还包括表情与口型。Live Avatar 把语音、视频生成与工具调用放进同一个实时流程:顾客说话,数字人一边回应、一边在后台查数据。97 种语言的口型同步能力,意味着同一个数字人可以切换语言服务不同客群,无需为每种语言另外录制视频。
管控设计:白名单与水印先行
数字人最大的争议是深度伪造。Google 这次设了两道闸:自定义形象必须通过企业白名单审核,降低拿真人肖像随意生成的风险;所有输出音视频都嵌入 SynthID,事后可识别为 AI 生成。再加上 US/EU 端点与预留吞吐量,瞄准的显然是对数据本地化与服务稳定性有要求的企业客户,而非消费级玩具。
与以往做法相比
过去做数字人客服,多半要自行对接语音、视频与口型驱动模块;如今以单一平台 GA 提供,集成门槛降低。但价格未公布,现在就断言「比真人客服便宜」还为时过早。
对管理者的意义:对运营客服中心、酒店前台或门店导览的管理者来说,这则新闻的启示不是「马上替换真人」,而是多语种接待的门槛正在下降。引入前应先想清楚三件事:哪些问题适合交给数字人处理、数字人背后能调用哪些系统数据、以及如何主动告知顾客对方是 AI(SynthID 是技术标记,不等于已向顾客披露)。较稳妥的起步,是先用内置形象库做常见问题导览的小范围试点,再评估是否申请自定义形象。