
7 月 28 日,李飞飞创立的 World Labs 发布技术博客,收购仿真企业 SceniX 之后对外展示机器人仿真训练最新进展,宣称打通 “真实任务 — 仿真世界 — 真实机器人” 闭环,可依托仿真生成训练数据。世界模型凭借模拟物理环境、供给机器人训练测试的能力,在具身智能热潮之下迅速走红,成为资本与产业重点关注的新兴赛道。
机器人与物理 AI 蓬勃发展的同时,原有技术路线的短板逐步显现。过去行业普遍依靠模仿学习,VLA 视觉‑语言‑动作模型成为主流。为积累训练素材,国内多地兴建机器人数采工厂。但转向量产目标之后,VLA 高度依赖真机数据的弊端凸显,真机采集成本高昂、周期漫长,很难覆盖现实世界海量长尾工况,机器人跨环境泛化能力不足。在此背景下,黄仁勋、杨立昆、李飞飞等业内领军人物将世界模型视作重要解决思路。
世界模型核心逻辑在于弥补 AI 对物理现实理解的短板。现有大模型大多学习文本、图片等间接素材,世界模型希望让 AI 如同人类一般,在交互当中预判动作带来的环境变化,掌握空间、物体与物理运行规律。不过行业尚未形成统一的定义与技术范式,视频生成、3D 引擎、自动驾驶、机器人领域都在使用该概念,各家架构、输出目标差异明显。腾讯张正友提出,面向机器人的世界模型,重点不在于生成好看的画面,而是预判动作发生之后环境的真实改变,需要和机器人感知、决策、行动形成闭环。
世界模型与 VLA 并非完全对立。VLA 擅长直接输出机器人控制指令,但对物理后果预判能力有限;世界模型更侧重环境状态预测。未来二者存在融合趋势,VLA 不断强化预测能力,世界模型接入动作生成,最终构建感知、预测、规划、行动完整闭环。国内不少企业已经开展相关探索,腾讯 RxBain 具身认知基座、生数科技 Motubrain 模型,分别尝试以不同架构实现物理世界理解。
对于世界模型能否复刻大模型涌现效应,业内判断分化。部分实验观察到类似缩放定律的迹象,但也有从业者认为,世界模型还处在 GPT‑3 早期阶段,模型、数据、筛选标准没有统一,能力涌现尚待验证。现阶段 VLA、世界模型、分层控制三条路线齐头并进,各有适用场景,不存在简单替代关系,整个赛道处于百花齐放的早期状态。
世界模型也并非万能解决方案,短期内很难直接打造通用机器人大脑,产业价值更多体现在数据生成、筛选、轨迹转换、训练评估环节。它可以修正人类示范动作,适配机器人本体差异,承担数据质量评估工作,但运行需要消耗大量算力。与此同时,世界模型对数据格式、时间戳、时序一致性提出更高标准,专门的具身数据需求持续上涨,带动上游数据、算力产业链发生变化。部分模型企业已经开展与本体厂商的适配合作,尝试兼容多类机器人硬件。
客观来看,当前人形机器人尚未迎来大规模量产,酒店、商超、家庭等非标准化商业场景落地有限。世界模型的进一步成熟,还需要硬件本体、底层运动控制与具身大模型多方同步迭代。