专栏 AI 管理编年史 第 112/217 讲 查看课程目录

Meta发布V-JEPA 2开源世界模型 支持机器人零样本规划

11/06/2025 260
4:38
Meta发布V-JEPA 2开源世界模型 支持机器人零样本规划

Meta AI于2025年6月11日发布V-JEPA 2,一款自监督式视频世界模型,结合逾百万小时网络视频与62小时真实机器人数据训练,能让AI代理理解、预测并规划物理世界互动,且已开源发布。

Meta AI于2025年6月11日发布V-JEPA 2(Video Joint Embedding Predictive Architecture 2),一款自监督式的视频「世界模型」。所谓世界模型,指的是AI不只看懂视频画面,还能理解物理世界的运作规律——物体如何移动、碰撞后会发生什么、下一步可能出现的状态。V-JEPA 2的训练数据包含超过100万小时的网络视频,再加上约62小时真实机器人操作数据进行微调,让模型具备「理解、预测、规划」三项物理世界互动能力。Meta同步将模型开源发布,并公布三项全新的物理推理评测基准,供业界检视模型的物理常识能力。

技术意义:从「看懂视频」到「预测物理世界」

过去多数视频AI模型专注在识别与描述画面内容,例如「这是一只猫在跳」。V-JEPA 2的关键突破在于「预测式架构」(Predictive Architecture):模型不是逐像素重建视频,而是在抽象的「表征空间」中预测视频接下来会发生什么。这种设计让模型能以较少运算资源掌握物理规律,例如物体的惯性、碰撞后的轨迹变化,进而支持机器人在陌生环境中规划动作。Meta特别强调,模型能达成「零样本机器人规划」——不需针对特定物体或场景额外训练,就能与从未见过的物体在新环境中互动,这对机器人研发是相当实用的能力,因为现实世界的物体与场景组合几乎无穷无尽,不可能逐一标注训练。

产业脉络:物理AI赛道竞争加剧

世界模型是近年AI业界积极布局的新赛道,NVIDIA已于2025年初推出Cosmos世界模型平台,锁定机器人与自动驾驶等物理AI应用;Google等厂商也各自投入相关研究。Meta在此次发布中,并未提供与NVIDIA Cosmos等竞品的直接量化性能比较数据,因此V-JEPA 2的实际运算效率与规划准确度,仍有待第三方独立测试与业界实际部署后才能确认相对表现。可以确定的是,多家科技巨头同时投入世界模型研发,显示这项技术被视为机器人与具身智能下一阶段发展的关键基础设施。

业界反应:开源策略延续Meta一贯路线

V-JEPA 2选择开源发布,延续了Meta在Llama系列以来的开源策略,与OpenAI、Google等倾向封闭API的路线形成对比。开源意味着全球研究机构与创业公司都能直接取用模型进行机器人研发,可能加速具身智能(Embodied AI)领域的整体进展,但也代表Meta在世界模型这个新兴赛道上,选择用开放生态圈而非商业授权来抢占话语权与影响力。同时公布的三项物理推理评测基准,也被视为Meta试图建立业界共同衡量标准的动作,类似过去语言模型领域MMLU、HellaSwag等基准扮演的角色。

对管理者的意义

V-JEPA 2代表的世界模型技术,是机器人与物理自动化走向「通用化」的关键一步——过去需要针对每个场景定制训练的机器人系统,未来可能通过这类世界模型大幅降低导入门槛。对于制造、仓储、物流等依赖实体自动化的产业管理者而言,这类技术进展值得持续关注,因为它可能在未来一到两年内降低机器人导入的技术与成本门槛,值得纳入中长期自动化规划的技术雷达。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Gemini 2.5 Pro与Flash正式GA,谷歌再推轻量版Flash-Lite

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策