世界模型正在被一群背景迥异的玩家重新定义。机器人公司、脑机接口企业、互联网巨头、数据服务商纷纷入场,从不同方向奔赴同一个目标:让 AI 真正理解并预测物理世界。
海外阵营技术路线分化清晰。英伟达推出开源全模态 Cosmos 系列,依靠海量视频数据搭建物理 AI 基础模型;DeepMind 迭代 Genie 3,进一步提升可交互虚拟世界生成能力;李飞飞创立的 World Labs 依托 Marble 主攻空间智能方向;特斯拉则持续聚焦机器人本体行动能力,走出独特路线。
国内企业布局层次分明,更加侧重产业落地。生数科技从视频生成模型 Vidu 出发,将技术沉淀迁移至通用世界模型赛道,提出 MoT(Mixture of Transformer)统一架构,把 “理解 — 预测 — 生成 — 行动” 整合至单一基座。大晓机器人将开悟世界模型 3.1 定位为面向端侧机器人的行动一体化世界模型,借助混合 Transformer 融合视觉、语言、力触觉、运动轨迹信息,瞄准家庭、零售、酒店等实景场景落地。
在传统大模型厂商、机器人企业之外,脑机接口企业开辟出全新赛道。深耕非侵入式脑机接口的强脑科技加速布局具身智能。WAIC 现场,其仿生手产品受到广泛关注,仿生手外形高度仿真,可实现远程意念操控。企业内部表示,单纯脑机接口仅能完成信号传输,缺少物理反馈闭环;具身智能可以补齐反馈环节,这套从意念指令、实体动作再到环境反馈的完整链路,能够为世界模型创造全新类型的训练数据集。
大量玩家入局,路线分歧也持续显现。 生数科技认为,视频生成与机器人控制底层均需要掌握物理世界运行规律,应当共用一套通用基座。生数科技 CEO 骆怡航提出,真正的世界模型需要能够刻画人与环境的交互规律,同时支撑人类与数字世界、物理世界双向交互。
但不少从业者提出警示,具身世界模型不能简单复刻视频生成模型。大晓机器人董事长王晓刚表示,数字领域模型预测出错仅影响内容生成,而物理场景中,智能体预判偏差会引发不可逆的实际损失,因此模型架构必须原生搭载物理推演、因果推理模块。
多条路线各有支持者,但行业达成关键共识:世界模型不能局限于视觉渲染。能够生成逼真画面仅仅是入场资格,精准预判物理世界后续演化,才是核心门槛。香港科技大学郭嵩教授提出,视频生成模型本质属于被动观测的 “渲染器”,欠缺环境交互能力。具身智能要求模型不止模拟世界,更能够改造世界,依托当前环境与目标,直接输出符合物理规律的速度、力度、运动轨迹等动作指令。
行业还在争论最优架构之时,资本已经持续加码。启明创投周志峰分享数据:近两年国内新增 370 余家具身智能企业,团队每周仍能收到 2 至 3 个新项目融资计划书。赛道头部集聚效应凸显,10 家企业估值接近 200 亿元,另有 20 家估值约 100 亿元。超高密度的创业项目,是本轮赛道热潮最直观的特征。
泡沫并不完全等同于坏事,各类技术路线可以依靠实景实践完成验证。但世界模型从实验室走向产业化,仍横亘三大核心挑战。
第一,技术路线尚未收敛。行业仍在多方探索:路线之争聚焦于发展视频生成类模型,还是侧重物理因果推演系统;打造通用大一统基座,还是深耕垂直场景专用模型,各家仍分头探索。
第二,虚实落地鸿沟难以跨越。行业从来不缺精彩演示,产业真正渴求的是具备稳定实用性、能够持续商用落地的方案。
第三,高质量数据或将构筑终极护城河。缺少独特数据源、没有规模化高效采集能力的企业,未来很容易被市场边缘化。
世界模型的潜力已经初步显现,但距离能力真正涌现仍有很长距离。上海财经大学汪源副院长指出,世界模型补齐人工智能理解现实世界的短板,是推动具身智能规模化商用的核心底座。一旦世界模型大规模驱动机器人自主物理决策,AI 安全、治理规范将成为必须同步考量的关键议题。
归根结底,世界模型赛道的终局注定是一场淘汰赛。能否胜出,由数据品质、产业深度理解、工程化落地能力三者共同决定。