
具身智能的技术路线之争正在从堆数据转向补物理规律。近日光象科技联合清华大学李升波教授课题组发布物理原生世界模型 Phi-WM 1.0 ActEffect(简称 ActEffect),据介绍这是 "物理原生智能"(Physics-native Intelligence,Phi)技术路线的首个模型化成果,该模型在 LIBERO、LIBERO-PLUS 和 RoboCasa-GR1 三项机器人操作基准测试中分别取得 98.8%、80.3% 和 67.5% 的平均成功率。
当前具身智能沿两条主线推进:一是 VLA(视觉 - 语言 - 动作)模型靠模仿学习看到什么做什么;二是视频预测式世界模型靠海量数据拟合未来会变成什么样。光象实验室首席科学家吕尧对《科创板日报》记者直言其本质是输入到动作的拟合关系,前端语言模型与后端动作专家之间存在模态鸿沟,仅靠超大规模数据训练 VLA 得到通用泛化的动作策略基本不现实。而纯视频预测型世界模型虽能吃到数据规模红利但 "性能从 99% 提升到 100% 过程中的幻觉问题难以解决" 且像素空间的迭代预测在推理部署上难以满足工业节拍。产业界信号同样密集,今年 4 月美国具身智能公司 Generalist AI 发布 GEN-1 模型明确定位为 "专为物理交互场景原生构建的基础模型" 将部分物理任务平均成功率从 64% 拉升至 99% 并把单任务适配数据压缩至约 1 小时。方向正在收敛:让机器人理解动作与后果之间的因果而非记住数据中的表层相关性。
据介绍 ActEffect 的核心机制是把世界模型从 "推理时的规划器" 改造成 "训练时的反馈器"。训练阶段策略模块一次性生成前馈、粗调、精调三个可执行动作提案,受控世界模型分别预测三个动作的后果并强制排序 —— 精调必须优于粗调粗调必须优于初始且不允许通过压低差方案的评估来 "作弊";后果预测环节刻意不接入语言指令因为 "夹爪施加这个力后零件会怎么动只由物理规律决定"。训练完成后世界模型被整体移出推理链路,部署时策略网络一次前向即输出动作 —— 推理算力成本不随训练成本线性增长这是其工业部署经济性的关键。
光象科技具身智能机器人目前已经在汽车制造场景落地实证。据公司披露其工业级自进化具身智能机器人 Phi-Bot X1 已在不止一家头部品牌车厂的真实产线正式工位完成产品与功能性能验证进入真机部署阶段;在汽车客户焊接上下料工位 X1 实现工件随机抓取以毫米级精度、0.3° 以内姿态精度完成双孔放置融入生产系统产生商业价值。在刚结束的 2026 世界机器人大会(WRC)上 X1 完成 5 天连续 36 小时焊接上下料与移动质检双工位自主循环作业。公司创始人张涛给出的账本是部署效率较传统工业自动化方案提升 10 倍以上新工位后训练与上机适配周期约数周真机后训练数据需求压至 "十几到几十小时、最多不超过 100 小时"。商业模式上光象按 "先卖机器人解决具体问题、二期升级能力客户续费" 的路径推进已在客户侧按此运作。
光象所处的赛道正被政策与资本双重加热但喧嚣之外也有泡沫寒冬论。张涛对《科创板日报》记者回应称如果行业维持现状 1 到 2 年内寒冬可能到来,穿越周期的方式是 "让具身智能的真实商业化价值真正被呈现"—— 第一个被验证可规模化的应用就是 "那把火"。