专栏 AI 管理编年史 第 119/217 讲 查看课程目录

Google DeepMind 发布 Genie 3:一段文字,就能走进 AI 实时生成的世界

05/08/2025 135
3:32
Google DeepMind 发布 Genie 3:一段文字,就能走进 AI 实时生成的世界

Google DeepMind于2025年8月5日发布通用世界模型Genie 3,只需输入一段文字,就能实时生成可导览的动态3D环境,24帧更新、720p分辨率,并能维持数分钟的环境一致性,率先开放给Google AI Ultra订阅用户测试。

Google DeepMind于2025年8月5日发布最新研究成果Genie 3,一款「通用世界模型」(world model)。与以往只能生成静态图片或固定时长短视频的生成式AI不同,Genie 3的特点是:用户只需输入一段文字提示,系统就能实时生成一个可以「走进去」的动态互动环境——画面会随着用户的移动和操作实时演算,就像在玩一款由AI实时生成的电子游戏。

根据官方博客公布的规格,Genie 3生成的环境画面刷新率达到每秒24帧、分辨率为720p,并且能在用户持续探索的情况下,维持长达数分钟的环境一致性——用户往前走再回头,此前经过的场景、物件摆放的位置仍然一致,不是每一帧都重新随机生成。发布当时,这项功能优先开放给付费订阅的Google AI Ultra用户测试,尚未对普通大众开放。

技术意义:从「生成画面」到「生成一个世界」

过去一年多,生成式AI视频工具(如Sora、Veo等)解决的是「把文字变成一段视频」,本质上仍是线性、预先算好的内容,用户只能被动观看。Genie 3要解决的是完全不同层次的问题:实时互动性与空间一致性。这意味着模型内部必须建立某种对「这个世界长什么样」的持续性表征(representation),而不只是逐帧预测画面。这也是为什么Google DeepMind将其定位为「世界模型」而非「视频生成模型」——它更接近游戏引擎的角色,只是内容不是人工建模,而是AI实时生成。

与前代及业界的比较

Google DeepMind此前已有Genie 1、Genie 2等世界模型研究成果,但可互动的时长、画面稳定度都远不及此次发布的Genie 3。「数分钟一致性」相较于以往世界模型普遍只能维持数秒到数十秒的稳定画面,已是明显的代际进步。业界普遍将世界模型视为通往更强大AI代理(agent)与具身智能(embodied AI)训练环境的关键基础设施——AI若要学会在真实世界中行动,先在低成本、可控的AI生成模拟环境中大量练习,会比直接在真实世界试错更安全、更经济。

对管理者而言,Genie 3目前仍是研究性质的技术展示,尚未成为可直接导入业务的工具,但值得留意的是:模拟训练场景与虚拟空间体验的制作成本,未来可能大幅下降。凡是依赖实境模拟做员工培训(如产线安全演练、酒店与旅游现场应对),或需要低成本打造虚拟展示空间(如电商展间、房地产预售案赏屋)的行业,都值得持续关注这类世界模型技术何时开放商用。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 OpenAI正式发布GPT-5:统一系统自动判断“快答”或“深思”

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策