專欄 AI 管理編年史 第 112/217 講 查看課程目錄

Meta發表V-JEPA 2開源世界模型 支援機器人零樣本規劃

11/06/2025 259
4:38
Meta發表V-JEPA 2開源世界模型 支援機器人零樣本規劃

Meta AI於2025年6月11日發表V-JEPA 2,一款自監督式影片世界模型,結合逾百萬小時網路影片與62小時真實機器人資料訓練,能讓AI代理理解、預測並規劃物理世界互動,且已開源釋出。

Meta AI於2025年6月11日發表V-JEPA 2(Video Joint Embedding Predictive Architecture 2),一款自監督式的影片「世界模型」。所謂世界模型,指的是AI不只看懂影片畫面,還能理解物理世界的運作規律——物體如何移動、碰撞後會發生什麼、下一步可能出現的狀態。V-JEPA 2的訓練資料包含超過100萬小時的網路影片,再加上約62小時真實機器人操作資料進行微調,讓模型具備「理解、預測、規劃」三項物理世界互動能力。Meta同步將模型開源釋出,並公布三項全新的物理推理評測基準,供業界檢視模型的物理常識能力。

技術意義:從「看懂影片」到「預測物理世界」

過去多數影片AI模型專注在辨識與描述畫面內容,例如「這是一隻貓在跳」。V-JEPA 2的關鍵突破在於「預測式架構」(Predictive Architecture):模型不是逐畫素重建影片,而是在抽象的「表徵空間」中預測影片接下來會發生什麼。這種設計讓模型能以較少運算資源掌握物理規律,例如物體的慣性、碰撞後的軌跡變化,進而支援機器人在陌生環境中規劃動作。Meta特別強調,模型能達成「零樣本機器人規劃」——不需針對特定物體或場景額外訓練,就能與從未見過的物體在新環境中互動,這對機器人研發是相當實用的能力,因為現實世界的物體與場景組合幾乎無窮無盡,不可能逐一標註訓練。

產業脈絡:物理AI賽道競爭加劇

世界模型是近年AI業界積極布局的新賽道,NVIDIA已於2025年初推出Cosmos世界模型平台,鎖定機器人與自動駕駛等物理AI應用;Google等業者也各自投入相關研究。Meta在此次發表中,並未提供與NVIDIA Cosmos等競品的直接量化效能比較數據,因此V-JEPA 2的實際運算效率與規劃準確度,仍有待第三方獨立測試與業界實際部署後才能確認相對表現。可以確定的是,多家科技巨頭同時投入世界模型研發,顯示這項技術被視為機器人與具身智慧下一階段發展的關鍵基礎設施。

業界反應:開源策略延續Meta一貫路線

V-JEPA 2選擇開源釋出,延續了Meta在Llama系列以來的開源策略,與OpenAI、Google等傾向封閉API的路線形成對比。開源意味著全球研究機構與新創公司都能直接取用模型進行機器人研發,可能加速具身智慧(Embodied AI)領域的整體進展,但也代表Meta在世界模型這個新興賽道上,選擇用開放生態圈而非商業授權來搶占話語權與影響力。同時公布的三項物理推理評測基準,也被視為Meta試圖建立業界共同衡量標準的動作,類似過去語言模型領域MMLU、HellaSwag等基準扮演的角色。

對管理者的意義

V-JEPA 2代表的世界模型技術,是機器人與物理自動化走向「通用化」的關鍵一步——過去需要針對每個場景客製訓練的機器人系統,未來可能透過這類世界模型大幅降低導入門檻。對於製造、倉儲、物流等仰賴實體自動化的產業管理者而言,這類技術進展值得持續關注,因為它可能在未來一到兩年內降低機器人導入的技術與成本門檻,值得納入中長期自動化規劃的技術雷達。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Gemini 2.5 Pro與Flash正式GA,Google再推輕量版Flash-Lite

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策