
机器人真正进入真实世界,不仅需要感知和执行能力,更需要理解环境如何变化,并在行动之前推演不同选择可能带来的结果。这正是 "具身大脑" 所承担的核心任务。
Scalabot 是松延动力面向真实世界打造的通用具身智能技术品牌,致力于构建机器人理解世界、推演未来与自主行动的核心能力,让智能从模型走向真实世界。
围绕这一目标,Scalabot 正在构建覆盖空间智能、世界模型与行动智能的 HERON 模型体系,通过真实世界数据、仿真数据与机器人反馈形成持续迭代的学习闭环,推动具身智能从单点任务能力走向可迁移、可扩展的通用智能。
9 月 8 日,Scalabot 正式发布 HERON 体系下首个核心模型 ——HERON-World Model,一款面向具身智能的动作条件世界模型。
HERON-World Model 聚焦于回答一个关键问题:当机器人采取某个动作之后,世界将会如何变化。
它让机器人不仅能够理解当前环境,更能够在行动之前对未来进行推演,为自主决策提供依据。
HERON-World Model,正是 Scalabot 朝着通用具身智能迈出的第一步。
让模型见过足够丰富的世界:Heron-World Model 的多源数据体系
如果要让机器人理解真实世界,第一步并不是让模型开始 "思考",而是先让它看得足够多。
但什么样的数据,才真正值得被世界模型学习?
HERON-World Model 建立了自己的预训练数据金字塔:真实机器人数据、基于真实场景重建的仿真数据、第一视角人类操作视频三类数据。
Data Pyramid for HERON-World Model
真实机器人数据最接近最终执行:它记录真实机器人在真实环境中的动作、视觉观测、本体状态以及控制命令,直接提供 "做了什么" 和 "世界发生了什么" 之间最可靠的对应关系,因此承担的是模型的真实执行锚点。
HERON-World Model 的数据覆盖单臂、双臂、轮臂和人形等不同本体形态,让模型能够接触不同本体下的运动与交互模式。
但真实世界采集有一个天然限制:有些情况很难反复发生,有些动作成本很高,还有一些失败轨迹甚至存在安全风险。
因此,我们使用了仿真数据,去补充真实采集中难以高频覆盖的稀有状态、危险交互、失败轨迹以及特定场景组合。
而对真实世界结构与资产的可复用重建,也将成为进一步扩展的基础。真实机器人数据负责校准可执行的动力学,仿真则进一步扩展 "执行 — 后果" 的组合空间。
我们也将持续推进相关真实环境重建与 3D 资产构建能力,让现实中的场景和对象能够进一步被数字化、重建并进入可学习、可交互的世界,为后续更大规模的世界建模与数据生成提供基础。
第三类数据则是引入第一视角人类操作视频数据,让模型看到大量机器人数据中很难低成本覆盖的场景:家庭物体、工具使用、双手协同,以及各种长尾的人 — 物交互。
于是,HERON-World Model 使用这种数据组合:机器人数据提供真实的行动经验,仿真数据扩展动作与后果,人类视频扩大交互的丰富度,以数据量成数量级的增长帮助模型不断拓宽所见的世界。
把不同动作变成同一种 "语言":HERON-World Model 的异构数据统一
在看到数据之后,问题也随之而来:这些数据虽然都是在描述 "世界",但它们各自都在说着不同的语言。
例如:机器人的动作可能是关节角,人类操作可能只有手腕轨迹;不同机器人有不同的坐标系、控制频率和本体结构;有些数据有完整动作标签,有些只有部分动作,还有一些甚至完全没有动作。
让模型见过足够多的世界,只解决了 "有没有数据" 的问题;真正困难的是怎么让这些完全不同的数据,最终被同一个模型理解。
HERON-World Model 没有简单地把原始数据直接混合,而是先对不同来源的数据进行系统性的规范化。多源数据并不是简单地 "混在一起",而是要先被翻译成模型能够共同理解的动作语言。
首先,要在物理空间中完成显示对齐:以视频帧的时间戳为基准,同步不同频率的控制指令、机器人状态与视觉轨迹;通过正向运动学把关节轨迹转换为末端执行器位姿,再利用手眼标定和相机外参,将机器人基座、相机、机械臂末端以及人类手腕轨迹统一到片段内的公共参考系,同时规范坐标轴方向、长度单位、旋转表示和抓取状态;
经过这些处理,来自真实机器人、仿真环境和第一视角人类视频的动作,被进一步整理为三类具有共同物理含义的信号:自身运动、操作端运动和抓取状态。每个动作都以视频片段首帧为锚点,描述机器人或人手从首帧到对应未来时刻,在统一动作空间中的累计变化。
但对于双臂、双手以及不同夹爪结构等不同末端执行器构型,它们之间仍然存在难以通过显式规则完全消除的差异。对此,HERON-World Model 并不强行要求所有动作拥有完全一致的数值形式,而是使用各数据域的轻量动作编码器,将不同动作进一步投影为固定维度的 Action Token,让共享网络在统一的视频预测任务中学习不同动作与视觉结果之间的共同规律。
也就是说,HERON-World Model 真正希望学习的并不是某一种机器人特定的动作形式,而是更一般的规律:当不同动作作用于世界时,它们会带来怎样的视觉变化和后果。
这也是为什么 HERON-World Model 并不要求第一视角人类视频,而是必须提供标准机器人控制命令。
在数据处理过程中,视频会经历片段清洗、三维手部姿态估计、相机轨迹恢复、轨迹验证和质量过滤,再把相机运动、手部运动和抓取状态转换成统一的动作表示。即便这些动作只是伪标签,它们仍然可以作为弱监督进入统一训练体系。
更重要的是,HERON-World Model 没有把 "完整动作标注" 设成视频能够进入训练的门槛。
完整动作、或者只有部分视频有可信动作标注,甚至有些视频,因为遮挡或者手部脱离画面等原因,无法获得数据标签,都可以进入同一套训练体系;对于缺失的动作组件,通过组件级掩码和置信度控制监督强度,而不是简单把缺失值当成 "0"。这样,即使一段视频没有完整动作信息,视觉与时间变化本身依然能够被模型利用。
这背后其实是一种很重要的思路:不是要求所有数据变得一样,而是允许它们保留不同来源的特性,同时把真正有价值的部分转换成模型可以共享的语言。
MoT+MoE:多专家合理分工
当数据足够多时,挑战从 "有没有数据" 变成了 "怎么让模型消化不同动作的建模方式"。
为了应对这个挑战,HERON-World Model 创新性提出 MoT+MoE 作为模型设计框架。
HERON-World Model 模型架构
MoT 架构配合着我们设计的单项注意力机制,很容易实现参数分离以及知识隔离,达到既可以充分利用 VLM 大模型内化的世界知识(例如 "机械臂是关节约束的刚体")约束物理可行的状态转移空间,还能有效避免跨帧物体变形等常见问题,防止随着模型训练伴随 VLM 的知识遗忘问题。
不同动作背后,往往对应着不同的运动建模方式:例如,人类或机器人身体、机械臂基座甚至移动底盘发生位移时,更多需要关注全局运动以及场景结构的变化;而在抓取、接触等瞬间,则往往伴随着更加复杂的局部几何、接触关系与精细交互变化。
随着数据数量级的增长带来的动作形式越来越多样性和复杂性,会产生更强的网络模型参数竞争,从而引出训练不稳定和生成能力下降的问题。
MoE 混合专家模式的优势越来越显著,因此在预训练阶段采用混合专家设计,是更适合大规模数据集 Scaling 的方案。
具体到执行层面,HERON-World Model 采用高噪声专家与低噪声专家的分工模式:高噪声阶段,由高噪声专家负责,重点建立未来的整体结构、场景布局与粗粒度运动;进入低噪声阶段后,切换至低噪声专家,重点恢复局部几何、细节以及精细交互。
它不是让两个专家同时抢着做同一件事,而是让它们在生成过程中承担不同的功能。
可以把它想象成写文章:先由编辑搭好整体大纲和逻辑框架;再由作者逐段填充细节、打磨词句。一个负责把未来 "写出来",另一个负责把未来 "写细腻"。
这样分工的价值在于:随着数据量级的增长,动作形式会变得越来越多样、越来越复杂,导致训练失稳与生成质量下降。拆成双专家模式后,各自参数分工更清晰,从根本上绕开了这一问题 —— 在数据与参数规模持续扩张的同时,依然能保证世界模型的生成质量。
结语
机器人真正进入真实世界,需要的并不只是一个更大的视觉模型,也不只是一个能够执行动作的控制模型。
它需要不断积累对世界的经验,并把 "看见什么"" 做什么 "和" 接下来会发生什么 " 连接起来。
这也是 HERON-World Model 选择的路径:
先让模型见过足够多的世界。
从真实机器人数据到基于真实场景重建的仿真数据,再到人类第一视角操作视频数据,把不同来源的数据建立共同纳入训练体系。
再让这些数据说同一种语言。
通过时间、空间和动作的统一,把原本异构的数据映射到共同动作空间的 Action Token,让模型能够学习跨机器人、跨场景的运动与交互规则。
最后,让模型拥有更强的未来生成能力。
通过 MoT+MoE 的模型架构,让不同专家分别负责全局结构与局部细节的生成,各司其职、分工明确,在数据与参数规模持续扩张的同时,保证世界模型的生成质量。
让模型见过世界,让不同世界彼此连通,再让模型真正开始推演世界。
(来源:Scalabot )