
如果把训练数据从 300 小时扩大到 30,000 小时,机器人模型能否像大语言模型一样,随数据增长不断解锁新能力?
智元最新发布的原生世界 — 动作模型(World Action Model,WAM)GE-Act 2.0,首次系统回答了这个问题。与沿用现成视频生成模型的主流路线不同,GE-Act 2.0 的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验 —— 覆盖 100 项原子任务、20 类技能、两种机器人本体。
结果显示,随着数据规模扩大 100 倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作,原生世界 — 动作模型的 Scaling 路径首次被系统性验证。
图中每个任务接受四档数据量训练(300 小时 / 1200 小时 / 5000 小时 / 30000 小时),随着训练数据不断扩大,技能覆盖范围与任务成功率同步扩大,这验证了原生世界 - 动作模型预训练与 Scaling 路径
项目主页与论文:https://ge-act-v2.github.io/
01/ 用 Zero-shot 检验预训练 用 100 倍数据验证 Scaling
针对评测任务做额外训练,能刷高成绩,却分不清能力来自通用预训练还是 "考前特训"。GE-Act 2.0 因此把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。在相同训练配方下,最后一阶段分别使用 300/1,200/5,000/30,000 小时四档数据,三条 Scaling 线索清晰可见:
技能 "逐格点亮":取得非零成功率的任务,在 G1-OP 机器人上从 39 项增至 76 项,在 G2-90D 机器人上从 24 项增至 72 项。折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,当数据达到 3 万小时规模时出现显著的能力顿悟;
任务成功率持续提升:G1-OP 机器人总体成功率从 17.1% 提升至 44.1%,G2-90D 机器人从 13.4% 提升至 31.1%,且 5,000 到 30,000 小时仍未见明显饱和;
"富本体" 带动 "稀缺本体":G1-OP 机器人贡献超 50% 训练数据,G2-90D 机器人占比不足 2%,但后者仍随共享数据扩大提升 17.7 个百分点,显示出跨本体能力迁移真实发生。
随着训练数据规模扩大,两种机器人本体的多数技能持续提升,数据占比不足 2% 的 G2-90D 同样获得明显增长
作为补充,微调后的 GE-Act 2.0 在 RoboTwin 陌生环境测试中取得 60.52% 成功率,在 GenieSim 指令遵循测试中获得 0.770 分,均超过 π0.5、GR00T N1.7 等参与比较的模型。
02/ 原生 World Action Model 如何预训练 GE-Act 2.0 给出了方法论
传统动作模型 "看到什么就做什么";世界 — 动作模型多走一步:先预测 "这样做下去,世界会变成什么样",再决定动作。然而大多数世界 — 动作模型从现有的视频生成模型出发,再接入动作模型,这种方法难以看清世界预测与动作能力究竟如何从具身数据中获得。GE-Act 2.0 设计了面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。
GE-Act 2.0 架构
01 原生高效表征:一帧画面压缩为 24 个 token
机器人既要看清物体和运动,又要控制计算成本。GE-Act 2.0 设计更高效的视觉编码器 CoAE,将一帧 256×384 画面压缩为 24 个视觉 token,仅为 DINOv3 的十六分之一,同时保留语义、运动与局部结构。压缩后反推动作的精度与 DINOv3、V-JEPA 2.1 等高信息量表征接近,在 4,000 条机器人操作数据的受控测试中,指令 — 画面匹配准确率达 97.95%,为五种对照表征中最佳。
02 原生视觉规划器:让 "想象" 与 "行动" 共同优化
世界模型负责预测未来,逆动力学模型(IDM)负责生成动作。传统方法需要多轮计算才能生成未来,计算与显存占用极高,既难以让两个模型共同训练,也会拖慢推理速度。GE-Act 2.0 采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在 RTX 5090 显卡上生成一个 chunk 连续动作仅需 104 毫秒,大幅优于现有大部分 WAM。
03 联合训练方案:KASO 破解 "预测和动作对不上"
同一任务常有多种正确做法:模型想象 "左手抓取",数据记录的却是 "右手",各自合理,合在一起就是错误信号。GE-Act 2.0 以知识对齐选择性优化方法(KASO):一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练,来解决这个问题。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高 7.5 个百分点,最终完成抓取的成功率提高 10 个百分点。
KASO 从多个预测未来中选出与真实动作最一致的结果,再用于联合训练,避免未来预测与动作监督错位
03/ 一套 "吃进所有数据" 的架构 遥操、无本体、Rollout、失败数据各就其位
机器人训练与部署中产生的数据形态各异,传统模仿学习依赖完整的 "指令 — 画面 — 动作" 配对,大量数据因此被浪费。GE-Act 2.0 提出的数据架构让每类数据承担合适的学习任务:
3.9 万小时 "指令 — 视频" 数据预训练世界模型,学习环境如何变化 —— 其中包含 3,000 小时无本体数据(不带动作标注的第一视角与人类操作视频);
3.2 万小时机器人轨迹预训练逆动力学模型(IDM),学习 "画面这样变化时机器人做了什么"—— 其中包含 2,000 小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;
3 万小时 "指令 — 视频 — 动作" 完整数据进行联合训练,把两种能力连接起来。
借助逆动力学模型,无指令、无成功标签、甚至失败的轨迹都能还原出动作监督信号 —— 失败数据也能成为训练资产。
分阶段预训练
GE-Act2.0 验证了原生世界 — 动作模型可规模化的预训练路径,也是从 "世界预测" 走向 "世界驱动行动" 的关键一步。在智元 GE 世界模型体系中,GE-Sim 面向策略评估与环境构建,GE-Act 将未来预测转化为真实机器人的操作能力。当更多类型的具身数据被统一利用、零样本能力随数据规模持续增长,具身基础模型的 Scaling 路径,正在变得更加清晰。
(来源:智元)