
全球机器人学习领域顶级学术盛会 ——Conference on Robot Learning(CoRL 2026)将于 2026 年 11 月 9 日至 12 日在美国得克萨斯州奥斯汀召开。会议聚焦机器人学与机器学习的深度融合,涵盖机器人基础模型、模仿学习、强化学习、多模态感知、机器人操作与自主决策等前沿方向,推动机器人从数据、示范和环境交互中学习,提升面向真实场景的智能与适应能力。
本次会议中,芝诺机器人联合创始人兼首席科学家植伟铭教授带领团队共有 4 项研究工作成功被收录。成果聚焦多机器人协作、长程机器人记忆、基于世界模型的执行监控,以及如何实时约束生成式机器人策略的推理。这些成果从不同角度探索机器人如何在真实世界中实现更加可靠、长程、协同的物理智能。
01 Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies
多机器人协作并不只是让多个机器人 "同时执行任务",更重要的是让机器人能够感知伙伴状态、适应伙伴行为,并在必要时主动等待、让步与调整自身动作。
当两个机器人共同搬运一个物体时,它们的动作并不是彼此独立的。一个机器人的等待、让步、拉动、释放或重新定位,都可能直接影响另一个机器人的动作。尤其在共享物体、物理耦合的任务中,机器人不仅需要理解自身状态,还需要在执行过程中持续适应协作者的动作节奏与状态变化。
针对这一问题,论文提出 Sequential Asymmetric Imitation(SAI),一种面向耦合多机器人行为的序列式非对称模仿学习框架。
SAI 不需要两个操作员同步采集双机器人协作示范,也不依赖显式的机器人间通信,而是通过分阶段训练,让机器人逐步适应更加真实的协作伙伴:
首先由单个操作员与机器人 A 进行示范,随后使用已经部署的机器人 A 作为协作者训练机器人 B,最后针对协作过程中出现的失败情况,对机器人 A 进行稀疏干预与进一步修正。
通过这一序列式训练过程,机器人逐步暴露于更加真实的协作状态,包括动作延迟、节奏不同步、让步不足以及物理交互冲突等情况。
在真实双机器人操作任务中,SAI 在任务成功率、动作同步以及针对协作者状态的让步行为等方面均优于独立模仿学习及不同课程学习基线。
要点速览:
面向物理耦合协作:聚焦双臂移动机器人在共享刚性或可变形物体操作中的协调问题。
非对称学习:不需要同步的双人遥操作示范,也不依赖显式机器人间通信。
序列式训练:通过 A→B→A 的训练流程,让机器人逐步适应真实协作者。
解决协作难点:通过局部观测与共享物理交互,针对等待、让步、拉动、释放等细粒度协同行为进行学习。
真机验证:在真实双机器人任务中显著提升任务成功率、阶段同步性与伙伴响应能力。
论文链接:
https://arxiv.org/abs/2606.16490
02 TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation
真实世界中的机器人往往会遇到这样的问题:
决定下一步动作所需要的信息,可能已经从当前视野中消失。
例如,机器人在任务早期看到过一个物体或目标位置,但当它真正到达需要做出决策的位置时,当前视觉环境可能已经无法区分不同的任务分支。此时,仅依赖当前视觉观测,机器人无法判断应该采取哪一种动作。
针对这种 "延迟证据" 问题,论文提出 TRACE(Trajectory-Routed Causal Evidence),一种面向视觉运动模仿学习的因果记忆框架。
TRACE 将任务相关的视觉信息与机器人状态信息存储在固定大小的潜在记忆中,并通过机器人已经执行过的轨迹特征作为记忆的索引。
与简单按照时间顺序存储历史信息不同,TRACE 使用具有几何空间敏感性的 trajectory signatures,将机器人此前的运动路径与当时观察到的关键信息建立关联。
当机器人之后再次遇到视觉上具有歧义的场景时,可以通过当前轨迹找到此前保存的关键证据,从而恢复已经消失的任务上下文,并选择正确的行为分支。
该方法可以通过轻量级 adapter 接入现有策略,在使用原有数据的条件下获得直接的性能提升,而无需修改原有策略。
在真实长程机器人操作任务中,TRACE 在分支选择和整体任务成功率方面均优于基线策略、短历史窗口记忆以及循环记忆等方法。
要点速览:
解决长程记忆:处理 "关键视觉信息已经消失,但机器人之后仍需要使用" 的任务。
轨迹作为记忆索引:不依赖原始时间或人工任务标签,而是通过机器人运动轨迹进行记忆检索。
固定大小记忆:在长时间任务中保持存储有界、范围可控的记忆。
轻量接入:即插即用,无需修改原有策略或训练目标。
提升长程任务能力:显著改善视觉歧义场景中的决策与任务成功率。
论文链接:
https://arxiv.org/abs/2606.14551
03 ContactGuard: Pre-Contact Execution Monitoring with Action-Conditioned Latent World Models
机器人操作中的许多失败,其实在真正发生之前就已经出现了可预测的征兆。
尤其是在接触丰富的操作任务中,当机器人真正检测到抓取失败、推偏、滑脱或碰撞时,关键接触往往已经发生,留给系统纠错的时间非常有限。
针对这一问题,论文提出 ContactGuard,一种基于动作条件潜在世界模型的接触前执行监控框架。
ContactGuard 不直接预测未来的视频像素,而是利用无标注机器人轨迹训练潜在世界模型。给定当前状态以及策略即将执行的 action chunk,模型向未来进行 rollout,预测短时间内可能出现的潜在视觉状态,并判断执行结果是否存在较高的失败风险。
在部署时,ContactGuard 会在关键接触发生前,以当前机器人状态为起点,根据策略计划执行的动作预测接触后的状态。如果预测结果偏离正常执行分布,系统可以在真正发生失败之前中止当前动作。
该方法无需修改底层机器人策略,可以作为独立的执行监控模块接入现有 visuomotor policy。
在真实接触操作任务中,ContactGuard 能够有效预测即将发生的执行失败,并迁移至真实机器人系统,实现接触发生前的主动干预。
要点速览:
从事后检测到事前预测:在错误真正发生之前识别潜在失败。
动作条件世界模型:根据策略计划执行的动作预测未来状态。
潜在空间 rollout:无需进行昂贵的像素级视频生成。
策略无侵入:无需修改底层 visuomotor policy 即可部署。
真实机器人验证:可作为接触前的实时执行监控和安全中止信号。
论文链接:
https://arxiv.org/abs/2608.13438
04 BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling
机器人策略在真实环境中部署时,一个重要问题是:
训练好的策略如何在面对新的约束和目标时快速调整,而不需要重新训练?
传统机器人策略的行为分布通常在训练阶段就已经确定。当新的安全约束、任务目标或环境障碍只在推理阶段出现时,机器人往往需要额外规划,甚至重新训练策略。
论文提出 BayesFP,将基于 diffusion 和 flow matching 的机器人策略重新表述为一个贝叶斯后验采样问题。
其中,从专家示范中学习到的行为分布被视为先验,而推理阶段新加入的任务目标和约束则通过 cost 构造 likelihood,从而在不改变原有策略参数的情况下,对动作分布进行引导。
在此基础上,研究进一步引入 Feynman–Kac corrector,将这一框架扩展到 deterministic flow-matching policy,使 diffusion 和 flow-matching 两类生成式机器人策略都能够进行无需重新训练的推理时调整。
这意味着,机器人可以保留原有策略学习到的行为能力,同时根据部署过程中临时出现的约束、目标和环境变化,动态调整生成的动作轨迹。
该工作与英伟达合作完成,在 Diffusion Policy、GR00T-N1.6 和 π0.5 等不同类型的预训练策略上进行了验证。模拟和真实机器人实验表明,BayesFP 能够有效处理推理阶段才出现的新约束,包括对此前未见的非凸障碍进行零样本轨迹调整。
要点速览:
推理时调整:无需重新训练基础策略,即可适应新的目标和约束。
贝叶斯策略建模:将学习到的行为分布作为先验,通过任务 cost 在推理阶段构造后验分布。
统一生成式策略:同时支持 diffusion policy 和 flow-matching policy。
零样本适应:面对部署阶段新出现的约束和障碍,可以即时调整动作轨迹。
多模型验证:在 Diffusion Policy、GR00T-N1.6 和 π0.5 等不同策略上完成验证。
(来源:ZENO芝诺机器人)