DeepMind SL2T 手语转文字随 Pixel 11 出货:手语 AI 走进手机内置功能
谷歌 DeepMind 于 2026 年 8 月 12 日宣布手语转文字模型 SL2T 随 Pixel 11 出货,进入 Gboard 听写与 Live Transcribe,不额外收费。训练数据逾 10 万小时视频、涵盖 50 多种手语,首批仅开放 ASL 转英文;采用混合式架构,原始画面即时丢弃,仅上传姿态坐标点。
谷歌 DeepMind 在 2026 年 8 月 12 日发布公告,宣布手语转文字模型 SL2T 随 Pixel 11 出货,并集成进两个已有的系统功能:Gboard 的手语听写,以及 Live Transcribe 实时转录。用户无需额外付费,也不必另行安装应用。谷歌形容这是手语 AI 第一次走出实验室、进入实际出货的消费级产品功能。
出货的到底是什么
SL2T 的训练数据超过 10 万小时视频、涵盖 50 多种手语,其中约四分之一为美国手语(ASL)。但首批实际开放的翻译方向只有一条:ASL 转英文。模型见过的语言很多,出货的只有一种,这中间的差距正是后续版本要补的功课。
形态上它不是一个独立的翻译应用,而是接进用户本来就在用的输入法与转录工具——对着摄像头比划,文字直接落进 Gboard 原本的输入框,等同于普通人的语音听写。不另开一个 App、输出仍落回原本的输入框,代价是必须开启摄像头取景并授予相机权限。
画面不离开手机:混合式架构的取舍
SL2T 采用混合式架构。设备端先由 MediaPipe Holistic 逐帧追踪面部、身体与双手上约 130 个关键点,抽成几何坐标;只有这些坐标会上传服务器完成翻译,原始画面即时丢弃。SL2T 直接把坐标序列翻成文字,跳过传统的 gloss 中介标注。
这样做同时处理两件事:手语识别必然要拍到脸(表情本身就是手语语法的一部分),改传坐标可大幅降低画面外流风险;坐标数据量也远小于视频流,更适合流式场景下的实时翻译。但必须提醒,面部与手部关键点仍属可识别的生物特征数据,上传服务器(且多半跨境)依旧构成个人信息处理,PDPA 与 GDPR 下的告知与同意义务并不因此免除。官方也未披露端到端时延与模型参数量。
70 BLEURT 这个分数该怎么看
DeepMind 表示 SL2T 在 FLEURS-ASL 基准上以 zero-shot 取得 70 BLEURT,称显著高于以往任何公开分数。这里的 zero-shot 指的是未针对该基准数据集另行微调,并非模型没学过 ASL——训练数据本来就有约四分之一是 ASL。这是厂商自报数字,截至 2026 年 8 月 12 日尚无第三方独立复现;SiliconANGLE、Engadget、Unite.AI 同日跟进报道,属于发布信息的交叉佐证,并非独立测试。真正的判准还是在现场:光线不佳的门店里、戴着手套的产线旁,它到底认不认得出来。
对管理者的意义
放进管理视角,有三件事值得记下:
- 无障碍沟通的成本结构变了。过去替听障同事配置手语翻译是排班与预算问题;当能力内置于员工自己的手机、不额外收费,问题就从“要不要编预算”变成“要不要调整流程”。
- 只开放一条翻译方向,现在还不能全押。首批开放的翻译方向只有 ASL 转英文,不含泰国手语(训练数据涵盖 50 多种手语是另一回事)。可行做法是小范围试用、记录真实错误,而不是急着写进标准作业流程。
- 数据落点要说清楚,但别当成免责。原始画面不离开设备这点值得对员工与法务讲明,然而上传的坐标点仍是个人信息,导入前仍须走完 PDPA 告知与同意流程。
一句话收拢:先小范围试、记录真实错误,再谈要不要写进制度。