專欄 AI 管理編年史 第 119/217 講 查看課程目錄

Google DeepMind 發表 Genie 3:文字一打,就能走進 AI 生成的即時世界

05/08/2025 133
3:32
Google DeepMind 發表 Genie 3:文字一打,就能走進 AI 生成的即時世界

Google DeepMind於2025年8月5日發表通用世界模型Genie 3,只要輸入一段文字,就能即時生成可導覽的動態3D環境,24幀更新、720p解析度,並能維持數分鐘的環境一致性,率先開放給Google AI Ultra訂閱用戶測試。

Google DeepMind於2025年8月5日發表最新研究成果Genie 3,一款「通用世界模型」(world model)。與過去只能生成靜態圖片或固定長度短片的生成式AI不同,Genie 3的特點是:使用者只要輸入一段文字提示,系統就能即時生成一個可以「走進去」的動態互動環境——畫面會隨著使用者的移動與操作即時演算,就像在玩一款由AI即時生成的電玩遊戲。

根據官方部落格公布的規格,Genie 3生成的環境畫面更新率達到每秒24幀、解析度為720p,並且能在使用者持續探索的情況下,維持長達數分鐘的環境一致性——使用者往前走再回頭,先前經過的場景、物件擺放的位置仍然一致,不是每一幀都重新亂數生成。發表當時,這項功能優先開放給付費訂閱的Google AI Ultra用戶測試,尚未對一般大眾開放。

技術意義:從「生成畫面」到「生成一個世界」

過去一年多,生成式AI影片工具(如Sora、Veo等)解決的是「把文字變成一段影片」,本質上仍是線性、預先算好的內容,使用者只能被動觀看。Genie 3要解決的是完全不同層次的問題:即時互動性與空間一致性。這代表模型內部必須建立某種對「這個世界長什麼樣子」的持續性表徵(representation),而不只是逐幀預測畫面。這也是為什麼Google DeepMind將其定位為「世界模型」而非「影片生成模型」——它更接近遊戲引擎的角色,只是內容不是人工建模,而是AI即時生成。

與前代及業界的比較

Google DeepMind先前已有Genie 1、Genie 2等世界模型研究成果,但可互動的時間長度、畫面穩定度都遠不及此次發表的Genie 3。「數分鐘一致性」相較於過去世界模型普遍只能維持數秒到數十秒的穩定畫面,已是明顯的世代進步。業界普遍將世界模型視為通往更強大AI代理(agent)與具身智能(embodied AI)訓練環境的關鍵基礎設施——AI若要學會在真實世界中行動,先在低成本、可控的AI生成模擬環境中大量練習,會比直接在真實世界試錯更安全、更便宜。

對管理者而言,Genie 3目前仍是研究性質的技術展示,尚未成為可直接導入業務的工具,但值得留意的是:模擬訓練場景與虛擬空間體驗的製作成本,未來可能大幅下降。凡是仰賴實境模擬做員工訓練(如產線安全演練、飯店與觀光現場應對),或需要低成本打造虛擬展示空間(如電商展間、房地產預售案賞屋)的產業,都值得持續關注這類世界模型技術何時開放商用。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI 正式發表 GPT-5:統一系統自動判斷「快答」或「深思」

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策