专栏 AI 管理编年史 第 35/217 讲 查看课程目录

Google DeepMind 发布 SIMA:能在3D虚拟世界里“动手做”的通用AI代理

13/03/2024 211
3:34
Google DeepMind 发布 SIMA:能在3D虚拟世界里“动手做”的通用AI代理

Google DeepMind 发布 SIMA,一个能听懂自然语言指令、并在9款不同游戏与4个研究环境中实际执行任务的通用型AI代理,标志AI从“回答问题”迈向“动手操作”。

2024年3月13日,Google DeepMind 正式发布研究成果 SIMA(Scalable Instructable Multiworld Agent),一个“通用型”AI代理系统。与过去针对单一游戏训练的AI(例如专精围棋、星际争霸的模型)不同,SIMA 的训练数据横跨9款不同工作室开发的商业游戏,加上4个DeepMind内部研究环境,涵盖从开放世界探索、建造,到动作解谜等多种类型的3D虚拟场景。

SIMA 的核心能力是:用户用自然语言下达指令(例如“打开地图”“往左走到那栋建筑物”“收集附近的木材”),SIMA 便能理解语义,并通过键盘鼠标等普通玩家使用的操作方式,在画面中实际完成任务——不需要游戏厂商为它开放特殊API或后门接口,这是与传统游戏AI最大的不同之处。

技术意义:从“看懂”到“做到”

过去一年多,生成式AI的进展多集中在“理解与生成文字/图像”,例如回答问题、写文案、画图。SIMA 展示的是另一条路线:AI 能否在一个陌生的3D虚拟空间里,把语言指令转换成一连串具体的操作动作并达成目标。这需要同时具备语言理解、空间感知、以及连续决策规划三种能力,难度远高于单纯的问答系统。DeepMind 强调,SIMA 学到的不是“某一款游戏的攻略”,而是可以泛化到“未曾见过的新游戏环境”的通用操作能力。

与既有技术的对比

相较于此前AlphaGo、AlphaStar等“单一游戏专精型”AI,SIMA 的价值在于“跨场域泛化”。它也不同于当时已知的语音助手或聊天机器人(如ChatGPT、Gemini)——那些系统主要停留在文字对话层面,并不直接操控一个具备物理规则的3D世界。SIMA 更像是把语言模型的理解能力,接上了一个能在虚拟环境中“动手”的操作接口,是AI从单纯“输出建议”走向“代为执行任务”的一次具体示范。

业界反应

发布后,业界普遍将 SIMA 视为“AI代理(AI Agent)”研究路线的重要指标性进展,也是DeepMind在通用人工智能(AGI)研究方向上的阶段性成果。多数评论也指出,此次公开版本仍属“研究预览”性质,尚未对外开放使用,短期内不会出现在消费级产品中;其意义更多在于证明“跨环境通用代理”在技术上可行,为未来AI从游戏世界走向真实世界任务(例如操作电脑软件、控制机器人)铺路。

对管理者而言,这则新闻真正的信号不是“游戏AI”,而是AI技术正从“回答”迈向“代办”的分水岭——未来一两年内,能够理解指令并自主执行多步骤任务的AI代理,很可能会出现在企业的内部系统操作、培训模拟等场景中,值得管理者提前关注这个技术路线的落地速度。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 马斯克说到做到:xAI 开源3140亿参数模型Grok-1

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策