首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
星尘智能发布 SmoothRL 框架
2026-09-06 19:37:44   具身之家综合

机器人最让人抓狂的失败,往往不是「不会」,而是明明已经会了,却总差那么一点。

Demo 里,这叫「差一点」;真正上岗以后,这就是一次失败。

机器人还不能像学生做题一样,做一道停下来想一道。更像人在打球:这一拍还没结束,下一拍其实已经在判断和准备了。现在的机器人大模型也是如此 —— 一次会生成接下来一小段动作,但推理本身需要时间。为了让动作不断,真实部署通常是手上还在执行计划 A,模型已经在后台计算计划 B。

这时候,问题就来了:机器人一边干活、一边继续学,在线强化学习到底该复盘哪一段动作?模型想过的,和机器人最后真正做过的,并不完全一样。

星尘智能(Astribot)团队发布在线强化学习框架 SmoothRL,由王佳楠担任项目负责人。它要解决的正是这个问题:机器人不停下来,模型继续推理,但学习只对准真正执行过的动作。

SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,让在线学习不只处理「最后几毫米」的精度问题,也进入连续加速、精确释放、不能停顿的动态操作。

没真正做过的动作,不能拿来复盘

异步推理真正麻烦的地方,不是机器人能不能把下一段动作接上,而是强化学习必须先搞清楚一件事:刚才到底哪些动作真的发生过。

可以把模型每次生成的动作序列(action chunk)理解成一小段提前写好的「计划」。等下一个新计划算出来时,机器人已经沿着上一份计划做掉了前几步;而这份新计划还没执行完,下一份计划又到了,后半段也可能被直接换掉。

机器人一边执行任务,一边产生新的真实数据;在线 RL 再根据这些结果持续修正下一步动作。

所以,模型虽然完整「想」了一段,真正控制过机器人的,往往只有中间那一截。

这对强化学习非常重要。就像复盘一场比赛,只能复盘真正打出去的球:机器人没做过的动作,不能因为任务成功被记功,也不能因为失败背锅。

SmoothRL 做的第一件事,就是把这笔账对齐。它把一段动作分成三部分:前面已经被上一轮动作占用的是 Committed Region,中间真正落到机器人身上的是 Execution Region,后面还没执行就被新计划替换的是 Discarded Region。策略更新只针对真正执行的中间这一段。

更关键的是,它连「怎么训练」也一起改了。SmoothRL 不会在训练时假设机器人可以规规矩矩地「算完再动」,到了部署时才改成边做边算;训练 rollout 本身就按照真实异步执行的节奏运行 —— 机器人继续动,模型继续推理,实际发生的轨迹再回到学习循环里。

团队把这个原则叫做 Reinforce in Deployment:机器人真实工作是什么节奏,强化学习就按什么节奏学。

三个真实任务,把「差一点」拯救回来

团队在 Astribot S1 上测试了三个真机任务,基础策略采用针对各任务微调后的 π0.5。

三个任务看起来很不一样,但共同点很明确:机器人已经基本会了,真正卡住它的是最后一点。

动态投掷:39%→94%。机器人要把不同位置的物体投进不同位置的目标箱。除了判断方向,还要根据远近调整释放速度,而且整个摆臂过程不能突然停下来。在累计 250 个 rollout episodes 的评估节点,成功率从 39% 提升到 94%。

给笔戴帽:8%→83%。双臂需要把笔和笔帽准确对齐,允许的相对位姿误差小于 5mm。基础策略往往已经到了目标附近,最后几毫米却经常对不上。

开箱:30%→90%。机器人要把约 1mm 宽的刀片插进只有 2-3mm 宽的箱盖接缝。基础策略存在稳定的左偏,经常直接扎进纸板;在线学习后,最终成功率达到 90%。

RL 补的,往往就是「最后几毫米」

比成功率更有意思的是,机器人失败的方式变了。

RL 之前,很多错误都有固定方向:投掷时不会根据目标远近稳定调整释放速度,开箱时刀片总往左偏,给笔戴帽时对不同位置的笔帽反应得太像。

在线 RL 做的,就是利用一次次真实执行结果,把这些固定毛病一点点磨掉。到最终 checkpoint,剩下的失败已经越来越接近成功。开箱任务的失败样本中,刀片相对接缝的左右偏差缩小到 1—2mm;给笔戴帽的失败样本也主要变成正确位置附近的小幅错位。

所以这次的 RL,并不是重新教机器人「怎么开箱」,而是在做一件更像真正工作的事:把「差不多会」练成「稳定做成」。

不仅更准,还要更平滑。在真实自主投掷 rollout 中,在线 RL 后右侧末端执行器的加速度 RMS 降低 52%,jerk(加加速度)降低 47%。机器人不仅更容易成功,动作还更平滑。

机器人上岗以后,训练并没有结束

过去几年,机器人基础模型主要解决的是「会不会」:用更多数据和更强模型,让机器人学会越来越多任务。

但真正开始干活以后,问题会变成「能不能稳定做好」。几毫米的误差、一次释放早晚、一个新的物体位置,都可能让一个看起来已经学会的任务失败。

SmoothRL 想补的就是这一层:机器人上岗以后,还能根据真实执行中的成功、失败和人工反馈继续调整自己。

不过,它现在也有边界:模型推理时间需要控制在预设预算内,而且当前方法主要是在冻结基础策略附近做有限幅度的修正。如果基础策略本身离正确动作太远,轻量 RL 模块也很难凭空救回来。

但至少在这三个任务里,可以看到一个很直观的范式:基础模型先让机器人学会怎么做,真实世界里的后训练,再把最后几毫米一点点练准。

SmoothRL 背后,延续了星尘在机器人模型上一条独特的长期判断:动作不是视觉或语言模型最后附带生成的结果,而应该成为机器人智能里的「第一公民模态」。因为机器人最终不只是为了看懂世界,更要在物理世界正确行动。所以 Lumo 系列基座模型始终关注「为什么要这样动」,从 Lumo-1 的显式推理、到 Lumo-2 预测世界因动作带来的变化,都在沿此思路发展。

在这条主线下,星尘也形成了从前端 Agent、中间基座模型、到 RL 后训练的完整模型布局:Agent 负责交互、记忆、理解任务与调用能力,基座模型逐步形成开放场景里可泛化的通用操作能力,RL 再从真实执行中的成功、失败和反馈中修正策略、持续进化。

在模型全面发展时,星尘「AI 模型 - 具身 OS - 绳驱本体」的全栈系统也在持续迭代,推动 Physical AI 的应用与规模化部署。

(来源:星尘智能)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有