DeepMind SL2T 手語轉文字隨 Pixel 11 出貨:手語 AI 走進手機內建功能
Google DeepMind 於 2026 年 8 月 12 日宣布手語轉文字模型 SL2T 隨 Pixel 11 出貨,進入 Gboard 聽寫與 Live Transcribe,不額外收費。訓練資料逾 10 萬小時影片、涵蓋 50 多種手語,首波僅開放 ASL 轉英文;採混合式架構,原始影像即時丟棄,僅上傳姿態座標點。
Google DeepMind 在 2026 年 8 月 12 日發布公告,宣布手語轉文字模型 SL2T 隨 Pixel 11 出貨,並整合進兩個既有系統功能:Gboard 的手語聽寫,以及 Live Transcribe 即時轉錄。使用者不需額外付費,也不必另外安裝應用程式。Google 形容這是手語 AI 第一次走出實驗室、進入實際出貨的消費性產品功能。
出貨的到底是什麼
SL2T 的訓練資料超過 10 萬小時影片、涵蓋 50 多種手語,其中約四分之一為美國手語(ASL)。但首波實際開放的翻譯方向只有一條:ASL 轉英文。模型看過的語言很多,出貨的只有一種,這中間的差距正是後續版本要補的功課。
形態上它不是一支獨立的翻譯 App,而是接進使用者本來就在用的輸入法與轉錄工具——對著鏡頭比劃,文字直接落進 Gboard 原本的輸入框,等同一般人的語音聽寫。不另開一支 App、輸出仍落回原本的輸入框,代價是必須開啟相機取景並授予相機權限。
影像不離開手機:混合式架構的取捨
SL2T 採混合式架構。裝置端先由 MediaPipe Holistic 逐格追蹤臉部、身體與雙手上約 130 個關鍵點,抽成幾何座標;只有這些座標會上傳伺服器完成翻譯,原始影像即時丟棄。SL2T 直接把座標序列翻成文字,跳過傳統的 gloss 中介標註。
這樣做同時處理兩件事:手語辨識必然要拍到臉(表情本身就是手語文法的一部分),改傳座標可大幅降低影像外流風險;座標資料量也遠小於影像串流,較適合串流情境下的即時翻譯。但必須提醒,臉部與手部關鍵點仍屬可識別的生物特徵資料,上傳伺服器(且多半跨境)依舊構成個資處理,PDPA 與 GDPR 下的告知與同意義務並不因此免除。官方也未揭露端到端延遲與模型參數量。
70 BLEURT 這個分數該怎麼看
DeepMind 表示 SL2T 在 FLEURS-ASL 基準上以 zero-shot 取得 70 BLEURT,稱顯著高於過往任何公開分數。這裡的 zero-shot 指的是未針對該基準資料集另行微調,並非模型沒學過 ASL——訓練資料本來就有約四分之一是 ASL。這是廠商自報數字,截至 2026 年 8 月 12 日尚無第三方獨立複現;SiliconANGLE、Engadget、Unite.AI 同日跟進報導,屬於發布訊息的交叉佐證,並非獨立測試。真正的判準還是在現場:光線不佳的門市裡、戴著手套的產線旁,它到底認不認得出來。
對管理者的意義
放進管理視角,有三件事值得記下:
- 無障礙溝通的成本結構變了。過去替聽障同仁配置手語翻譯是排班與預算問題;當能力內建於員工自己的手機、不額外收費,問題就從「要不要編預算」變成「要不要調整流程」。
- 只開放一條翻譯方向,現在還不能全押。首波開放的翻譯方向只有 ASL 轉英文,不含泰國手語(訓練資料涵蓋 50 多種手語是另一回事)。可行做法是小範圍試用、記錄真實錯誤,而不是急著寫進標準作業流程。
- 資料落點要說清楚,但別當成免責。原始影像不離開裝置這點值得對員工與法務講明,然而上傳的座標點仍是個資,導入前仍須走完 PDPA 告知與同意流程。
一句話收攏:先小範圍試、記錄真實錯誤,再談要不要寫進制度。