Gemini Robotics 2 登場:Google DeepMind 讓人形機器人有了「全身智能」
Google DeepMind 於 2026 年 7 月 30 日發表 Gemini Robotics 2,一次推出 VLA、ER 2、On-Device 2 三款實體 AI 模型,讓人形機器人從腳到指尖全身協調,並在 Apptronik Apollo 2 上實機展示。On-Device 2 數小時適配新本體,象徵機器人硬體與智能層正式解耦。
Google DeepMind 於 2026 年 7 月 30 日發表 Gemini Robotics 2,同場推出三款實體 AI(physical AI)模型:
- Gemini Robotics 2 VLA:最先進的視覺—語言—動作模型,將視覺與語言輸入直接轉為馬達控制,可指揮人形機器人「從腳到指尖」全身協調——行走、蹲下、彎腰、伸展並操作物件,雙手與夾爪的靈巧操作也提升到新等級。
- Gemini Robotics ER 2:具身推理 VLM,支援影片理解、即時空間推理、多步任務規劃與任務編排,並能跨不同機型協調多台機器人協作;依 Gemini API 棄用時程,舊版 gemini-robotics-er-1.6-preview 將於 8 月 31 日關閉,由 ER 2 接棒。
- Gemini Robotics On-Device 2:可完全本地端運行、不需雲端連線,且能在數小時內適配全新的機器人本體。
DeepMind 並在合作夥伴 Apptronik 的 Apollo 2 人形機器人上實機展示:自主行走、蹲下彎腰收拾雜亂房間、與其他機器人組隊協作加速完工,並即時推理多步複雜任務。同場也公布針對人形機器人的新安全措施。
技術意義:從「桌面手臂」到「全身智能」
過去的機器人 AI 多停留在固定式手臂的抓取與擺放;Gemini Robotics 2 VLA 把控制範圍擴到全身——步態、重心、下蹲與雙手協調由同一個模型統籌,代表實體 AI 正式跨入「whole-body intelligence」階段。值得注意的是,官方這次公布了自評 benchmark 數據:全身操作(Apollo 搭配 Inspire 靈巧手)拾取成功率桌面 68.4%、地面 45.7%、層架 76.3%;多指靈巧手(SharpaWave)轉開燈泡達 92%、夾爪(Franka Duo)精密插入 89.6%。數字誠實揭示了現況——全身操作成功率仍屬中段,離量產等級的可靠性還有距離,且這些均為官方自測數據,仍待第三方驗證。
與前代及競品比較
相較即將退場的 ER 1.6,ER 2 補上了多機器人協作與任務編排,讓一群機器人能分工完成同一目標。而 On-Device 2「數小時適配新本體」是對產業結構影響最深的一項:機器人硬體與智能層就此解耦,企業不再被單一硬體供應商綁定,換機體不等於換掉整套 AI。
對管理者的意義
製造、倉儲與服務業的人形機器人導入時程被實質往前拉,但官方自揭的成功率也提醒我們離「無人化」還遠。管理者此刻該做的不是急著採購,而是盤點自家現場哪些「全身型」工作——搬運、補貨、整理房務——最可能先被機器人接手,並在選型時把「智能層可否跨硬體遷移」列入採購條件,避免被單一機體綁死。