
当马斯克还在为 Optimus 的量产跑供应链审厂时,一家成立仅 4 年的初创公司,已经把机器人派进了 30 个陌生的美国家庭 —— 没踩点、没彩排、没采集一个数据点,直接上岗干活。
这家公司叫 Figure,马斯克曾经的 "徒弟",如今的对手。
一个人走进一个陌生的房子可以立即开始工作,是因为我们对于物理世界的认知和理解可以在不同的环境之间迁移:我们不会因为床的高度不同而重新学习如何整理床铺,也无需因为家具不同而重新学习如何打扫房间。但目前的机器人还做不到这一点,它们必须逐个学习自身所处的工作场景,一次只能掌握一个环境。
9 月 17 日推出的 Helix 2.5,是 Figure 公司迄今为止构建的最先进神经网络。
Helix 02 已经证明,神经策略可以实现人形机器人全身动作的长时序任务协调,例如从洗碗机中取放餐具,以及自主完成长达 200 小时的物流任务。但这些系统的学习数据均来自机器人实际运行的场景。
而 Helix 2.5 的研发是为了回答一个更难的问题:人形机器人进入一个从未见过的房屋后,能否立即独立自主地调动全身完成工作?
为了验证这一点,在 Figure 大规模的人类行为数据集 Index 的基础上,对 Helix 2.5 进行了预训练。基于这个单一的基础模型,实现了三种行为:打扫客厅、折叠毛巾和整理床铺。随后,将机器人带入 30 户未采集任何环境数据的旧金山湾区家庭。
一场 "盲测",没有彩排
Figure 选取了三项全身性任务:打扫房间、整理床铺和折叠毛巾。
这些任务共同对感知、移动、操作、双手协调以及全身控制能力提出了要求。即使在固定环境中,每项任务也颇具挑战性。还提出了更难的问题:同样的行为能否立即在全新环境中奏效?
大多数关于机器人泛化的研究,都是在围绕机器本身构建的环境中展开的。例如,桌面机械臂仅在固定的作业空间内运行;轮式机器人需要足够的开阔地面以容纳其底座并进行移动转向。而家庭环境通常不具备这样的条件。
人形机器人必须在完成任务的过程中自主穿行,调整身体姿态,在其他形态机器人无法进入的狭小、杂乱空间中观察、抓取并操作物体。
因此,任务就成为一个全身性的难题。机器人可能需要先移动以找到物品,然后调整姿态去抓取它。感知、移动和操作无法割裂开来单独解决。
零样本泛化进一步提高了难度。机器人在训练期间从未见过房间布局和具体物品,到达后也无法进行适配调整。它必须依靠已有知识来解决全部的感知与控制问题。
即使在熟悉的环境中,这种复杂度的人形机器人自主行为也十分罕见。据了解,Helix 2.5 是首个能在陌生家庭环境中,针对从未见过的物品实现零样本泛化的系统。
这并不意味着通用人形机器人技术已经完全成熟。但 Helix 2.5 首次证明:全身智能可以从人类行为经验中学习,并将知识迁移到全新场景中,而无需每次都重新构建数据框架。
成功率从 9% 提升至 56%
Figure 在旧金山湾区的 30 个陌生家庭中,借助陌生物品对 Helix 2.5 的三项任务进行了评估。这里的 "零样本" 特指测试环境和操作对象是全新的,而任务本身是通过在其他场景采集的微调数据来规范定义的。
所有评估用家庭的环境数据均未被采集过。任务规范定义数据中未出现任何用于评估的玩具、毛巾或床品。机器人直接使用每个陌生家庭中原有的沙发、床和折叠台面。
测试物品在实验开始前就已单独存放,并经过 AI 模型筛查和人工复核,确认其未出现在任务规范定义数据中。测试按照评估前制定的标准打分,任务成功的标准为:
l 客厅清理:场景中散落的 13 至 15 个玩具全部被拾起并放入篮子中。
l 毛巾折叠:所有毛巾均被折叠并放入篮子中。
l 床铺整理:枕头和被子角均摆放至床头位置,被子拉平。
每项任务在全部 30 个家庭中都使用同一个固定的检查点。模型权重未针对测试家庭或物品做任何适配,检查点的选择也没有参考任何测试运行数据或测试表现。
l 在 30 个真实家庭中实现零样本全身自主运行。Helix 2.5 在 30 个未见过的家庭环境中执行了三项长时序任务,并且全程没有借助对环境或操作对象的数据采集、微调或适配。据我们所知,这是人形机器人首次在如此广泛的范围内实现零样本全身泛化。
l 一个基础模型,覆盖三种全身行为。仅单一经过 Index 预训练的基础模型即可适配三种不同的行为任务,内容涵盖移动、刚性与可变形物体的操作、双手协调以及主动感知。
l Index 预训练推动泛化能力提升。在保持特定任务数据、模型架构、训练流程和评估标准不变的前提下,仅通过 Index 预训练,就将零样本任务成功率从 9% 提升至 56%。
l 行为规范定义成本减半,而覆盖范围扩大 30 倍。Helix 2.5 所使用的特定任务数据仅为典型 Helix 02 任务行为的一半,却能将该行为泛化到 30 个陌生的家庭环境中。
l 发现一种人类行为到人形机器人的迁移缩放规律。反复将 Index 预训练数据翻倍,可稳步提升下游机器人动作预测性能。其规律足够稳定,我们甚至在训练前就能将我们最大规模运行的损失值预测到小数点后四位。
这并不意味着通用人形机器人技术已经完全成熟。但 Helix 2.5 首次证明:全身智能可以从人类行为经验中学习,并将知识迁移到全新场景中,而无需每次都重新构建数据框架。
更少数据,更强泛化
我们还探究了另一个问题:预训练是否会影响定义新行为所需的机器人数据量?
为验证这一点,我们将 Helix 2.5 与先前训练的用于执行相同任务的 Helix 02 策略模型进行了比较。Helix 02 的训练数据直接采集自其评估环境,而 Helix 2.5 在仅使用了一半适配数据的情况下,就达到了与之相同的成功率,并且能够在 30 个陌生家庭环境中实现零样本迁移。
在长时序任务中,自主纠错能力至关重要,在陌生环境中尤其如此。Helix 2.5 的一个显著提升就是它的自主纠错能力:它会后退调整站位、改变身体姿态,或是绕整张床走一圈来修正折叠的位置。我们认为这种从失误中恢复并持续推进任务的能力,是 Index 预训练带来的重要效果。
缩放规律改变了语言模型的发展,它表明下一个词元的预测效果会随着数据量和算力的增加而可预测地提升,让人们可以通过小规模训练预测大规模运行的结果。
我们想知道,人类行为到机器人的迁移是否也遵循类似的缩放规律。在 Index 的嵌套子集上训练了四个模型,预训练数据量跨度达到 8 倍,同时保持模型规模和下游训练不变。每个模型都在相同的任务数据上微调,并用相同的留出集动作预测损失进行评估。
结果显示,Index 数据每翻倍一次,损失值就呈现出可预测的下降趋势。据了解,这是首次在人形机器人上验证的人类行为到机器人的迁移缩放规律:Index 预训练能够可预测地提升下游机器人的下一步动作预测效果。
这种规律的精确度足以支撑预测。仅凭借小规模训练的结果,Figure 就能在训练开始前,将最大运行的测试损失预测到小数点后四位。在整个 8 倍数据量的区间内,预测误差仅占数据波动幅度的 0.54%。
本研究仅衡量了数据的缩放,而固定了模型大小和下游训练。但这表明,语言模型扩展中的一个核心规律可能同样适用于人形机器人领域:我们可以在训练前,就预估下一次人类经验数据翻倍能带来的能力提升。
规模化的时机已经成熟
一年前,Figure 提出了一项论断:机器人技术在模型规模、计算能力、尤其是数据方面,都落后了多个数量级。而 Index 就是 Figure 为弥补这一差距所做的尝试,核心问题很简单:人形机器人能否从人类经验中学习到足够的知识,从而不再需要逐个学习它未来要工作的每一个场景?
Helix 2.5 是 Figure 迄今为止最有力的证据,证明答案很可能是肯定的。在三项行为任务和 30 个陌生家庭的测试中,经过 Index 预训练的策略模型无需针对特定环境微调,就能泛化到全新的布局和物品上。而随着 Index 数据量增加,迁移效果平稳提升,足以被衡量为一种缩放规律。
这一方法正逐渐被人工智能的各个领域所熟知:在预训练阶段广泛学习,一次完成行为定义,然后在部署时实现泛化。
目前,Index 每秒就能生成约 35 分钟的全新人类行为数据,Figure 已承诺投入 35 亿美元的算力用于 Helix 的训练。如果 Helix 2.5 的表现具有代表性,更多的数据和算力将直接转化为机器人进入新环境前对物理世界更深入的认知。
现在,规模化的时机已经成熟。