首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
生数科技发布 Motus2:面向灵巧操作的自进化通用世界模型
2026-09-14 17:55:56   转载自生数科技

面向机器人灵巧操作的「自进化通用世界模型」,生数 Motus2 来了!

世界模型的关键,不止是预测下一帧画面,更是能预演行动后果、判断怎样做更好,并把这些评估用于持续改进行动策略。

让机器人把手动起来,和让它真正拥有一双 "巧手",还有一段距离。它需要从人类操作中学习经验,也需要在与物体交互时感知变化、调整动作,逐步积累自己的 "手艺"。

在前代 Motus 基础上,Motus2 从大规模第一人称人类操作数据中学习:从单目视频到双目视频与人类动作,再通过机器人轨迹和人机对齐数据,将这些经验迁移到灵巧手操作中。

在模型侧,Motus2 将行动、预测、评估三种能力统一进同一个共享参数的模型。它可以生成候选动作,预演这些动作可能带来的结果,再判断哪一种更有助于推进任务。这些评估既能用于规划时的动作选择,也能在进一步训练中用于更新策略,形成 "生成动作 → 预测未来 → 评估结果 → 更新策略" 的闭环。

针对灵巧操作中的接触问题,Motus2 还引入了轻量触觉专家模块,根据最新的触觉反馈细化动作,让操作调整有视觉之外的接触依据。

举个假想的例子:一个机器人正在学煎蛋。如果只复现教学视频里的手势,鸡蛋一滑、锅的位置一变,原来的动作就未必管用了。一个会思考的学徒,则会先比较几种办法:这样拿稳不稳?换个角度会怎样?哪一种更有可能把蛋煎好?真正动手时,还要根据手指与鸡蛋的接触调整力度;继续学习时,再把对不同做法的判断转化为更熟练的操作。

先想清这一步,再学好下一步。Motus2 所追求的「自进化」,就是让对行动后果的判断,持续推动操作能力的进步。

三个关键词,看懂 Motus2

第一,首个全模态统一世界模型

在视觉、语言与动作之外,Motus2 进一步引入触觉专家模块,让机器人不仅能 "看见" 物体,也能感知接触状态的变化,支持更精细的灵巧操作。

第二,首次实现闭环自进化迭代

一个模型同时承担策略、模拟器和评估器,让机器人可以利用自己的世界模型产生反馈,再反过来优化自己的行动策略。

第三,首个高自由度灵巧手世界模型

Motus2 以大规模纯人类第一视角(Ego)数据进行预训练,结合百小时级机器人领域中间训练和目标任务微调,已部署在单手 22 自由度 Sharpa Wave 和单手 20 自由度 WUJI Hand 2 等触觉灵巧手上。

约 13 万小时第一人称人类数据构成的多层次 Ego 数据体系,从人如何操作物体,到机器人真正完成动作,Motus2 正在尝试把人类已有的大规模操作经验,迁移给机器人。

01|先看真机:拧灯泡、撕纸、翻书、找东西

先不讲模型,先看机器人能做什么。

对准灯座,把灯泡旋转安装直至点亮;双手配合撕下厨房纸;甚至记住此前看到的信息,在多个杯子中找到被隐藏的方块。

这些动作对人来说很自然,对机器人却并不简单。尤其到了灵巧手阶段,问题已经不只是 "能不能抓起来",而是:怎么捏、怎么转、什么时候松手、力度是否合适、接触状态有没有变化。

Motus2 已公开翻书、开易拉罐、擀面团、多指抓取、拧灯泡、双手撕纸、寻找隐藏物体等一系列真机演示,有的需要双手配合,有的依赖持续接触反馈,还有的必须记住此前看见的信息。

02|一个模型,打通行动、预测与评估的闭环

以模仿学习为主的传统机器人策略模型主要解决一个问题:现在看到这个状态,下一步做什么?

而面对位置、姿态不断变化的物体,机器人还需要进一步判断:这一步做下去,结果会怎样?

Motus2 则把这个问题交给同一个视频 — 动作模型中的三种能力:

行动(Policy / WAM):生成机器人动作;
预测(Simulator / AC-WM):预测动作执行后世界会发生什么;
评估(Evaluator / VM):判断结果是否更接近任务目标。

简单来说,就是同时回答三个问题:下一步做什么?做完会发生什么?这个结果好不好?机器人不再只是执行动作,也开始拥有理解行动后果、判断行动价值的能力。

训练时,还要守住一个顺序:动作依据当前已有的信息生成,不能提前 "偷看" 未来答案;预测再读取候选动作,评估最后结合动作和预测结果做判断。普通控制可以只生成动作,需要规划或策略学习时,再调用预测与评估能力。

把三种能力放进同一个模型,只是第一步。更关键的是,让预测和评价真正参与动作改进:训练时,让模型学着提出更好的动作;执行时,从候选动作中挑选更好的方案。临场选对一次,与下一次更容易做对,是两种不同的进步。

先看它怎样 "学得更好"。训练时,模型生成多个候选动作,预测它们可能带来的未来状态,再由价值模型判断哪些结果更有利于完成任务。这些评分会进一步用于更新机器人策略。

让高价值动作更容易被提出,让低价值动作逐渐减少。这一阶段只更新动作相关参数,预测和评估部分保持不变,避免改进动作时连判断依据也一起变动。

也就是说:模型自己预测出来的未来,开始成为训练自己的反馈。

这也让失败数据变得更有价值。

假如一次抓取用力不当,杯子被挤变形了,这个动作当然不该照着学。但 "这样做会带来什么结果",恰恰是机器人需要补上的经验。

因此,成功轨迹告诉机器人 "应该怎么做";失败和次优轨迹则帮助它理解:做了什么、世界发生了什么、为什么没有完成任务。失败的动作不值得照搬,失败带来的信息却值得留下。

在真正执行动作之前,Motus2 还可以通过 Best-of-N 机制 "多想一步":提出多个候选动作,分别预测结果并评分,再选择更优方案执行。做完一段动作,它重新读取现场的真实变化,再规划下一步。这里的 "多想一步",改变的是本次选择,不会直接更新模型参数。

在手机放置与多指操作两项真机任务中,基于模型的强化学习将平均成功率从 65% 提升至 72.5%;进一步加入推理时规划后,达到 75%。相比基础模型,提升 10 个百分点。

03|13 万小时人类数据,持续提升模型能力

机器人数据昂贵,很难像互联网视频一样快速扩展。但人类每天都在和真实世界交互。拿杯子、开瓶盖、翻书、整理物品,本身就是天然的大规模操作数据。

问题是:能不能先让模型从这些经验中学习,再把学到的本领迁移给机器人?

Motus2 因此构建了一套多层次 Ego 数据体系,底层是约 13 万小时第一人称人类数据,包含单目与双目来源。所谓第一人称,就是从操作者自己的视角,看手怎样与物体打交道。整个训练路径可以概括为三步:

首先,先看人怎么做。通过大规模单目 Ego 视频,广泛学习拿取、移动、接触等操作中的物体变化,学习基础世界知识和操作规律。

然后,再理解手与物体的关系。加入双目视频和动作数据,补充深度线索,进一步学习更细粒度的空间位置关系和手 — 物交互信息。

最后,迁移到机器人身体。人手与灵巧手并不完全相同,存在视觉和形态上的差异,看到人会做,不等于机器人已经会做。通过 100 多小时机器人轨迹与人机对齐数据,把人类经验适配到真实机器人的控制空间。

实验也显示,在当前测试范围内,随着双目数据从 2000 小时增加到 2 万小时,模型的人类动作预测误差持续下降。更多高质量人类交互数据,依然能够持续提升模型能力。

04|灵巧操作,不只是 "看得准",还要 "记得住、摸得到"

真正进入复杂物理世界,还有两个能力绕不开:记忆和触觉。

比如,一个方块被藏在三个杯子中的一个下面。等杯子重新摆好后,仅看当前画面已经无法判断目标在哪。

机器人必须记得:刚才发生了什么。

Motus2 因此进一步研究长时信息机制。在寻找隐藏方块、根据历史提示完成操作等任务中,保留完整历史信息的平均成功率达到 57.5%;保留近期与部分关键观测、同时压缩其余历史的混合方案为 25.0%。不过,记得更完整,也意味着更多计算与缓存开销。

而在撕纸、抽纸杯等任务中,仅靠视觉也不够。机器人还要知道:碰到了吗?抓紧了吗?物体有没有滑?看得见,不等于摸得准。

为此,Motus2 加入轻量级触觉专家模块,主模型先规划动作,触觉模块在每个短动作片段执行前读取最新接触反馈,再做细化。可以理解为,大脑先想好怎么做,指尖再根据实际接触纠偏。它还复用主模型已有的中间计算结果,不必每次重新运行完整视频骨干。在抽取纸杯与撕纸两项真机任务中,加入触觉后,平均成功率从 60% 提升至 72.5%,提升 12.5 个百分点。

05|五项真机任务,平均成功率 84%

最终,模型到底有没有用,还是要回到真实机器人上验证。在论文设置的五项主要真实机器人任务中,Motus2 的平均成功率达到:84%。

其中,一个对照实验尤其值得关注。在相同的目标任务微调流程下:仅经过人类第一视角数据预训练的模型,平均成功率为 51%;进一步加入机器人领域中间训练以后,成功率提升到 84%。提升 33 个百分点。

这意味着,从人类视频中学习操作经验,确实可以成为机器人的能力基础;而把这些经验适配到机器人自己的身体与控制方式上,才能进一步提高实际操作的成功率。"看过人怎么做",开始转化为 "用自己的手做成"。

相关实验最终在采用 WuJi Hand 1、WuJi Hand 2、Sharpa Wave 灵巧手的三种双臂机器人配置上完成。所有能力,最终都要落回真实的物理世界。

06|从在世界中行动,到开始自我进化

近期,生数科技提出了通用世界模型(GWM)的五级演进路线:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。

这并不是五类彼此独立的模型,而是一条能力不断累积的演进路径。从生成世界、理解世界,到在世界中行动,机器人首先要解决的是 "如何行动";而再往前一步,则需要模型能够评价自己的行动结果,并利用真实反馈持续改进自身策略。

Motus2,是这条路线在具身智能中的一次具体实践。它已经具备 L3「在世界中行动」的核心能力:理解当前状态、预测行动后的未来,并生成真实机器人动作。在此基础上,Motus2 又进一步把 Evaluation 与 Feedback 显式纳入闭环:行动 → 预测 → 评估 → 反馈 → 再学习。

这一机制呈现出类似 RSI(Recursive Self-Improvement,递归自我改进)的初步特征:模型利用自身对世界的预测和评估结果,反过来改进行动策略。世界模型开始具备一定的自我演进能力,也是从 L3 走向 L4"自主世界智能体" 的一次重要探索。

当然,从多任务的策略优化,到开放世界中的长期自主学习和持续进化,还有很长的路要走。但 Motus2 向前验证了一步:从 L3 的 "能够行动",走向 L4 的 "能够自主进化",评价与反馈开始真正进入世界模型的闭环。

Motus2,是这条路上的一次初步尝试。

(来源:生数科技)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有