Gemini Robotics 2 登场:Google DeepMind 让人形机器人有了“全身智能”
Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics 2,一次推出 VLA、ER 2、On-Device 2 三款实体 AI 模型,让人形机器人从脚到指尖全身协调,并在 Apptronik Apollo 2 上实机演示。On-Device 2 数小时适配新本体,标志机器人硬件与智能层正式解耦。
Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics 2,同场推出三款实体 AI(physical AI)模型:
- Gemini Robotics 2 VLA:最先进的视觉—语言—动作模型,将视觉与语言输入直接转为电机控制,可指挥人形机器人“从脚到指尖”全身协调——行走、蹲下、弯腰、伸展并操作物件,双手与夹爪的灵巧操作也提升到新等级。
- Gemini Robotics ER 2:具身推理 VLM,支持视频理解、实时空间推理、多步任务规划与任务编排,并能跨不同机型协调多台机器人协作;依 Gemini API 弃用时间表,旧版 gemini-robotics-er-1.6-preview 将于 8 月 31 日关闭,由 ER 2 接棒。
- Gemini Robotics On-Device 2:可完全本地运行、无需云端连接,且能在数小时内适配全新的机器人本体。
DeepMind 并在合作伙伴 Apptronik 的 Apollo 2 人形机器人上实机演示:自主行走、蹲下弯腰收拾杂乱房间、与其他机器人组队协作加速完工,并实时推理多步复杂任务。同场也公布针对人形机器人的新安全措施。
技术意义:从“桌面机械臂”到“全身智能”
过去的机器人 AI 多停留在固定式机械臂的抓取与摆放;Gemini Robotics 2 VLA 把控制范围扩到全身——步态、重心、下蹲与双手协调由同一个模型统筹,代表实体 AI 正式跨入“whole-body intelligence”阶段。值得注意的是,官方这次公布了自评 benchmark 数据:全身操作(Apollo 搭配 Inspire 灵巧手)拾取成功率桌面 68.4%、地面 45.7%、层架 76.3%;多指灵巧手(SharpaWave)拧开灯泡达 92%、夹爪(Franka Duo)精密插入 89.6%。数字诚实揭示了现状——全身操作成功率仍属中段,离量产级可靠性还有距离,且这些均为官方自测数据,仍待第三方验证。
与前代及竞品比较
相较即将退场的 ER 1.6,ER 2 补上了多机器人协作与任务编排,让一群机器人能分工完成同一目标。而 On-Device 2“数小时适配新本体”是对产业结构影响最深的一项:机器人硬件与智能层就此解耦,企业不再被单一硬件供应商绑定,换机体不等于换掉整套 AI。
对管理者的意义
制造、仓储与服务业的人形机器人导入时间表被实质提前,但官方自揭的成功率也提醒我们离“无人化”还远。管理者此刻该做的不是急着采购,而是盘点自家现场哪些“全身型”工作——搬运、补货、整理客房——最可能先被机器人接手,并在选型时把“智能层能否跨硬件迁移”列入采购条件,避免被单一机体绑死。