首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
人形机器人不止会空翻 更懂技能组合
2026-09-01 16:49:58   具身之家综合

  人形机器人要真正进入为人类设计的环境,行走只是起点,它们还需要完成奔跑、跳跃、翻滚、转身、躲避障碍等高动态动作,并在任务变化时自然切换技能。更难的是,这些动作既要稳定,又要有类似人类的协调性与节奏感。传统方法通常依赖简化动力学模型、分层规划器或针对单一任务设计的奖励函数,容易产生“持续迈步”“膝盖长期弯曲”“身体冲击较重”等不自然动作;强化学习虽然已经让人形机器人掌握了平地行走、爬楼梯、奔跑和复杂地形穿越,但每增加一种行为,往往都需要新的奖励设计、参数调节,甚至从头训练,且这些方法通常局限于特定动作或特定目标,缺乏组合多样化技能的通用性。

  如今,加州大学伯克利分校、斯坦福大学团队实现了新的突破。他们提出的基于强化学习的运动跟踪框架BeyondMimic,能够让人形机器人先从人类动作学习,再通过引导式扩散模型进行技能组合与任务适配。基于这一框架,人形机器人可以在统一的训练设置下学习数百种动作,包括空中侧手翻、旋踢、翻踢、冲刺和舞蹈,并将这些技能迁移到真实硬件上;一旦部署后,机器人还能处理训练阶段没有见过的路径导航、摇杆遥操作、障碍物躲避和动作插入任务。相关研究论文近日发表在权威科学期刊Science Robotics上。

  BeyondMimic的目标,是让人形机器人在训练阶段未见过的下游任务中合成多样化动作,同时保持持续的敏捷性和类人的自然感。框架包括两个阶段:第一阶段使用可扩展的强化学习运动跟踪,从多样化的人类动作中训练出一组具备高动态能力的运动技能;第二阶段使用统一的潜在状态-动作扩散模型,将这些技能整合到同一个运动分布中,并通过分类器引导在推理阶段根据新目标生成和组合动作。

  第一阶段的任务,是从人类示范中学习一组可迁移的运动技能。研究团队没有为每种动作设计独立的奖励和训练流程,而是让不同参考动作共享同一套运动跟踪公式、奖励设计、观察空间、动作空间和超参数。以往方法通常面临两种选择:训练单个多技能策略具有较好的可扩展性,但强化学习探索不足时容易产生不自然的动作;针对每种动作分别训练专门策略,则可以提高自然度,却需要针对动作逐一调参,难以扩展到大规模技能库。BeyondMimic采用统一的运动跟踪流程和共享超参数,在可扩展性与动作自然度之间取得平衡。这一阶段还结合了精确的执行器建模、较少的域随机化、连续的方向表示、无历史观测和低延迟部署。训练数据包含约2.5小时的人类动作,机器人在高保真仿真中验证了全部动作,并将21个代表性动作片段部署到真实机器人上,总时长约15分钟,涵盖了单腿站立、起身等平衡行为,也包括单腿跳、转身踢、带180°或360°旋转的前跳、空中侧手翻等高动态动作,以及老年人风格行走、舞蹈、网球、羽毛球、地面爬行等具有不同风格和接触模式的技能。

  在第二阶段中,研究团队训练了一个统一的潜在状态-动作扩散模型,将第一阶段得到的多种运动技能整合起来。与只生成动作的扩散策略不同,潜在状态-动作扩散模型不仅预测动作,还隐式捕捉动作对未来状态的影响,使模型能够在推理过程中对未来轨迹进行预判,为任务适配和技能切换提供基础。模型的关键能力来自分类器引导,它是一种基于梯度的引导过程,可以在生成过程中使用任务相关的成本信号,将无条件动作生成引导为面向特定目标的条件生成。在预测控制过程中,模型首先预测未来一段时间的状态和动作,再通过多轮去噪逐步修正预测结果,使轨迹朝指定目标收敛,目标可以是期望速度、路径点、关键姿态或障碍物距离。这使规划和控制不再完全分离。传统解耦式方案通常由运动学扩散规划器离线生成参考轨迹,再交给独立的物理跟踪器执行,容易重新引入规划器与跟踪器之间的不匹配;BeyondMimic将规划与控制放进同一个潜在状态-动作模型中,允许分类器引导直接在真实硬件上进行测试时调整。在这一机制下,机器人能够根据速度指令在行走和奔跑之间切换,也可以从摇杆控制的行走状态平滑进入翻滚、旋踢或翻踢,再回到原来的运动模式;通过输入稀疏的未来关键帧,系统还能补全关键帧之间的中间动作,实现动作补全。

  研究团队从三个层面评估了BeyondMimic:一是机器人能否在真实环境中还原多样、高动态的人类动作;二是通过用户研究,看看走路和跑步的姿态是否够自然;三是测试统一控制器能否依据速度、路径点、关键帧、障碍物这些目标,在推理阶段灵活切换动作、组合任务。结果表明,BeyondMimic不仅能把多种运动技能稳定地搬到真实硬件上,面对没见过的任务时,动作依然连贯流畅,也保留了明显的类人特征。在多样动作与人类水平敏捷性方面,研究团队在室外软土、落叶和不平整地面上测试了机器人,这些接触条件没有出现在训练数据中,但机器人仍然完成了空中侧手翻、连续侧手翻、地面爬行、从地面跳起以及受武术启发的动作。在空中侧手翻过程中,机器人峰值加速度达到31米每平方秒,骨盆角速度最高达到15.7弧度每秒,平均角速度为7.01弧度每秒,与熟练人类空中动作报告的约7.75弧度每秒平均角速度相当,且落地时保持了较好的姿态控制。

  为评估动作的自然程度,研究团队组织了77名参与者进行用户研究,观看BeyondMimic与宇树原生控制器的20组行走和奔跑片段,最终获得1539次有效选择。整体而言BeyondMimic获得了70.8%的偏好,分步态来看,行走动作中偏好率为57.0%,奔跑动作中偏好率达到84.7%。机器人在行走过程中受到人为轻微扶持时,会保持一定柔顺性,暂停并稳定在原地,外力释放后再平滑恢复行走,体现了控制器在自然运动之外对外部干扰的适应能力。这项工作还关注BeyondMimic能否在推理阶段根据不同目标组织已经学到的技能,研究团队测试了速度命令、路径点导航、关键帧动作插入以及障碍物躲避等任务。在命令条件运动实验中,面对不同初始位置,机器人能够生成平滑轨迹到达目标点;通过摇杆输入时,它可以跟踪全向速度指令,并在受到踢击等较大外部扰动后继续朝目标移动;在更长距离的测试中,机器人沿赛道连续奔跑超过50米,仿真评估显示行走和奔跑的平均速度跟踪误差分别为12.14%和13.65%。研究团队还使用动作补全测试动作插入能力,机器人原本处于摇杆控制的行走状态,系统每隔0.2秒插入翻滚动作的目标关键帧,扩散策略随后生成连续轨迹,使机器人从行走平滑进入空中侧手翻,完成动作后又回到命令控制的行走状态;同样的方法还支持从行走过渡到躺下、再起身站立,以及从行走切换到旋踢和翻踢等高动态动作。在任务组合实验中,研究团队将路径点跟踪成本与障碍物躲避成本结合,实现了简单的场景感知导航,机器人面对正前方的障碍物时,在扩散去噪过程中利用障碍物距离信息调整未来轨迹,最终绕开障碍物并到达目标点。

  当然,BeyondMimic框架还有很多需要改进的地方。研究团队表示,其扩散模型非常依赖底层状态估计系统的质量,如果本体感知出现误差,错误信息会直接传播到生成轨迹中;当前系统的预测时域足以支持反应式控制和局部避障,但不足以完成需要提前判断远距离目标或障碍物的长程规划;历史信息有助于稳定未来预测,但也可能让模型在引导过程中陷入重复动作模式,机器人因此在动作开始和结束阶段仍更容易出现绊倒;此外,当前基于引导的优化更适合粗粒度目标,对精细控制的效果相对有限,仍需对引导权重进行轻量调节。研究团队认为,未来可以探索监督微调和适配器式控制层,从而支持更细粒度、可组合的轨迹控制,减少人工调参需求。

  BeyondMimic的价值不只在于让机器人完成某个翻滚或某段奔跑,而在于把高质量动作学习、技能切换、任务规划和实时控制放进同一个框架。当新增的人类动作可以持续扩展技能库,而新的任务只需提供目标成本、不必为每项任务重新训练时,人形机器人就有可能从“按预设动作执行”走向“根据环境组织行为”。这也是BeyondMimic所指向的长期方向:让机器人直接从人类示范中学习,并在不同动作、环境和目标之间保持适应能力。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有