
二十世纪 80 年代,机器人学家汉斯・莫拉维克提出了一个耐人寻味的观察:对机器而言,抽象推理未必比感知、行走和抓取更难。这就是莫拉维克悖论(Moravec's Paradox)。今天,AI 已经能够写代码、解数学难题,但弯腰捡起地上的水瓶,再稳稳站起来,仍在考验人形机器人的能力。Physical AGI 的真正难点,不只是推理,更是让智能扎根物理世界:将感知、移动、操作与全身协调融为一体,在重力、接触和环境变化中,把任务意图转化为可靠行动。
成立半年,源策未来(Archon Robotics)交出了面向这一难题的阶段性答卷:以预训练为核心、由高质量人类全身数据与自研 S0 运动控制基模系统支撑的人形基础模型系统。以及在不同机器人本体上的实机成果:从俯身取物、跨越台阶,到自主清理餐桌、操作洗碗机和整理冰箱。源策以全身智能(Whole-Body Intelligence,WBI)【1】为技术路线,让机器人学会调动整个身体,完成真实环境中的任务。
全身智能(WBI)实机成果及训练过程展示
为什么选择人形
我们选择人形机器人作为全身智能的重要载体,首先是因为现实世界中的楼梯、橱柜、工具和工作空间大多围绕人类的身体形态与行为方式设计。人形机器人能够更好地适应这些既有设施,减少对环境的改造。更重要的是,人类在长期生活与劳动中积累了丰富的全身交互经验:面对不同高度的物体、不同布局的空间,人会自然地调整站位、姿态和动作,让身体配合任务。
具备人形结构,并不意味着机器人就能像人一样完成任务。相比汽车、无人机、机械臂和四足机器人,人形机器人需要在同一具身体上协调移动、平衡与双手操作。双足支撑有限,伸手、俯身和搬运物体都会改变身体的重心与受力,上下半身必须根据任务持续协同调整。因此,人形机器人的智能不能局限于手部操作或局部运动控制,而需要具备协调全身感知、决策与动作的能力。即使是一个看似简单的日常任务,也往往需要整个身体共同参与。
真实超市场景,机器人俯身取放商品。
从人类经验到机器人能力
预训练的基础,是能够持续扩展的高质量数据。源策 WBI 数据平台积累了大量自采 EgoBody 全身人类数据,覆盖人在不同场景中的移动、姿态调整与物体操作。EgoBody 将第一视角与同步身体运动联系起来,不只记录手最终拿走了什么,也记录身体怎样调整站位、俯身伸手,让操作成为可能。
一段经验进入训练,先从任务设计开始。任务由源策内部设计,并分发到全国不同城市采集,完成后回流质检。不同柜子、物体和空间会带来不同站位和动作;平台按场景、物体与技能组织并动态调整任务分布,将这些差异纳入采集,而不是只在同一场地重复同一动作。数据回流之后,还必须过质量这一关。平台通过机器全检、人工抽检与异常全检共同把关,并借助可视化检查对应第一视角、身体运动和任务内容。数据规模增长,不应只是数量增加,更重要的是有效经验能够被记录、检查并用于模型学习。
源策全身人类数据可视化系统
真机后训练进一步将预训练先验转化为适应具体本体的操作能力。除了成功示范,源策还引入人形机器人 DAgger 纠正机制:当执行出现偏差、模型进入示范覆盖不足的状态时,操作者将介入给出纠正示范,相关状态和动作进入后续训练,补充只学习顺利示范时可能遗漏的经验。比如按键前手部位置偏了,标准示范提供正确按压方式,纠正经验则补充 "已经偏到这里,怎样重新对准"。
让全身能力跨越本体
我们构建了以预训练为核心的全身智能训练体系。S1 人形智能基模系统从 EgoBody 人类全身数据中学习身体、环境与动作之间的关系,再通过高质量真机数据后训练,适配具体本体与任务。S0 运动控制基模系统则将动作意图转化为稳定、可执行的全身运动。两者衔接,把人的交互经验转化为机器人的实际能力。
预训练技术路线及 S1、S0 系统架构
S0 的关键,在于协调复杂地形适应、全身稳定与任务关键操作位置。跨上厨房台阶、踏上踏台时,足部接触高度和支撑关系不断变化,机器人需要协调落脚、躯干姿态与重心转移;俯身拾瓶、侧身或跪地取物时,身体要充分运动,手部仍要接近目标位置。
S0 模型在不同地形完成指定任务
与图中所示的开源模型相比,S0 能够更准确地跟踪目标、更稳定地控制身体,让手、脚与躯干协调配合。
俯身向下触地,展示的是机器人能够稳定操作的空间有多大:既要够得低、够得远,也要在触达和起身的整个过程中保持稳定。在这组对比中,开源模型的触达范围受到限制,继续前伸时也更容易失稳;S0 控制的机器人则能够稳定触地,并平稳地恢复站立,将全身协调转化为更大的稳定可达范围。
小幅左右移动,展示的是跟踪精度与响应能力。当动捕员做出细微的位置调整时,对比中的开源模型没有明显跟随,而 S0 能够及时响应、准确跟踪。在狭窄空间中调整站位,或接近物体、准备操作时,这种精细的控制能力同样重要。
S0 模型对比(左侧为开源模型,右侧源策模型)
S1 则进一步将执行能力组织成连续任务。洗碗机操作需要依次适应门轴转动、碗篮滑动与餐具抓放;餐桌清理需要从物体抓取切换到持续擦拭。坐到沙发上整理水果时,身体支撑条件发生变化,上肢任务仍需继续。做米饭从准备内胆到合盖、按键,前一步的结果为下一步创造条件。要学的不只是手往哪里走,还有任务到了哪一步、接下来如何衔接。
S1 基于海量人类数据的预训练路线,为跨本体提供了技术支撑。G1 餐桌清理与 T2 洗碗机自主操作。
同一 WBI 技术路线已适配宇树 G1 与加速进化 T2,进入餐桌清理、洗碗机操作和冰箱整理等自主任务场景。系统针对不同的身体比例、关节配置和运动约束进行适配,将任务要求落实为不同本体各自可执行的动作,推动全身能力在更多硬件平台上落地。这里的跨本体适配并不等同于未经适配的零样本迁移。
让智能走进真实世界
全身智能正在成为国内外行业共同关注的方向。近日,美国 Figure 公司 的 Helix 2.5【2】与 Google DeepMind 的 Gemini Robotics 2【3】,分别从人类行为预训练、任务适配及全身控制等方向展开探索。不同技术路线共同面对的问题是:如何从海量人类经验中学习大量复杂动作,并让不同本体机器人在真实身体与环境约束下完成各类场景工作。
我们将持续扩展数据与预训练,提升跨本体适配、全身控制和自主任务的可靠性。我们期待与本体及数据伙伴【4,5,6】、研究团队、场景应用方携手,让人形机器人逐步走进家庭与工作场所,承担整理、清洁、搬运等实际劳动。
物理世界不会因为 AI 到来而重新设计。源策未来希望让智能学会在其中行动,把人的经验转化为机器人能够学习的能力,让繁重、重复的劳动逐步交给机器。今天,我们把进展放进镜头;接下来,我们要把能力带进日常。
(来源:源策未来)