首页
资讯
品牌
机库
评测
选购
租赁
组件
算力
社区
开发者
视频
赛事
活动
人物
展会
排行
------
反馈
行业动态
Jim Fan、李飞飞团队新作:机器人也能「上下文 scaling」
2026-07-31 10:43:22   具身之家综合

  当前绝大多数具身智能机器人策略普遍存在 “短期记忆” 短板,模型只能利用单帧或者极短时段的视觉运动信息,执行多步骤、长时序任务时极易遗忘历史进程,难以连贯完成复杂装配。借鉴大语言模型上下文扩展思路,研究界开始探索机器人领域的上下文缩放路径。英伟达高级研究科学家 Jim Fan 联合斯坦福大学李飞飞团队推出 RoboTTT(Test-Time-Training Robot Policies),给出一套面向机器人视觉运动策略的长上下文建模范式。论文显示,该框架支持 8K 时间步上下文,形成长达 5 分钟的连续 “肌肉记忆”,突破现有技术上限,同时推理阶段算力开销保持稳定。

RoboTTT 核心创新在于把测试时训练(TTT)融入 VLA 视觉 - 语言 - 动作机器人基础模型,以快速权重充当循环记忆载体。传统长上下文方案需要存储海量历史观测序列,推理算力随时序拉长持续上涨;而 RoboTTT 在每一轮传感器输入时执行轻量化梯度更新,把历史交互信息持续压缩进固定大小的快速权重之中。无论上下文时长如何延伸,隐状态占用资源恒定,机器人部署之后还能够持续在线学习,解决长时序记忆的算力瓶颈。整套体系由三大核心设计构成。  

其一为分层模型架构。整体采用 VLM 骨干搭配嵌入 TTT 层的 DiT 动作头。注意力层负责处理单时间步空间信息,TTT 层放置于注意力模块后端,专门处理跨时序关联。为降低运算负担,系统依靠少量寄存器 Token 传递时序信息,避免全部视觉 Token 进入 TTT 运算;同时引入 Tanh 门控机制,平衡新增时序能力与模型原有预训练通用技能,防止新模块破坏基础操作能力。  

其二是适配超长序列的训练方案。框架融合序列动作强制策略与截断时间反向传播(TBPTT)。序列动作强制为不同动作片段独立采样噪声,稳定 Flow-Matching 训练流程;TBPTT 把超长时序切分为多个片段,仅在片段内部反向传播梯度,但快速权重可以跨片段持续传递时序信息,在可控显存消耗前提下,实现完整长序列的 TTT 训练。  

其三是长上下文约束训练机制。模型区分两类时序数据:仅充当记忆上下文、不参与动作损失计算的观测序列,以及用于监督训练的动作序列。依托该机制搭建两种重要学习范式:视频模仿模式,仅使用人类演示视频更新快速权重,无需配对机器人轨迹即可实现一次性模仿;DAgger 蒸馏模式,完整轨迹写入记忆,仅在人类修正动作上计算损失,让机器人自主学习失败场景下的纠错逻辑。  

团队在三项长时序双臂装配任务中开展系统性对比测试,以 GR00T N1.7、Gated DeltaNet 作为基线,验证上下文缩放带来的性能增益。实验呈现多项关键结论。首先,RoboTTT 整体任务完成率达到 79%,在包含 10 个子步骤、时长约 5 分钟的齿轮机器人装配任务中,是唯一能够完整跑完全流程的模型。单纯拼接历史观测帧无法稳定提升性能,部分场景下甚至造成效果下滑,证明高效时序记忆不能依靠简单缓存历史画面。  

其次,性能随预训练上下文长度持续提升,没有出现明显饱和迹象。8K 时间步版本任务完成分数相比 1K 版本提升 62%;与之对照,GDN 循环状态方案无法通过拉长上下文持续收获收益。根源在于 RoboTTT 依靠梯度更新快速权重,具备元学习能力,而传统线性循环状态缺乏持续进化空间。  

同时模型具备强大的少样本模仿与扰动恢复能力。在电路装配任务中,仅依靠一段人类演示视频,RoboTTT 就能适配全新配置,60% 试验取得成功;当外界人为移除已经装配完成的零部件,机器人能够识别状态异常、回溯流程重新装配,扰动恢复成功率全面高于基线模型。依托改良 DAgger 蒸馏方案,机器人可以在线从自身失误中自主修正,相较标准 DAgger 方案平均性能提升 33%。  

这项研究首次证明,上下文长度是继参数量、数据量之后,机器人基础模型又一条可行的缩放路线。Jim Fan 进一步提出展望,未来百万级时间步长上下文具备落地可能性。但方案仍存在明显短板:延长训练上下文会推高训练算力成本;TTT 层优化目标函数仍有广阔探索空间;当前测试场景集中于仿真装配任务,现实工业复杂环境下各类极端失败模式尚未完全覆盖。后续团队计划结合高效 TTT 训练技术、强化学习算法,持续优化长时序机器人策略。  

从产业视角来看,当前工业人形机器人、双臂协作机器人大量面临多工序连续作业需求。现有的 VLA 模型普遍时序视野受限,很难自主完成一整套连贯装配流程。RoboTTT 提供一条可行路线:无需爆炸式增加推理算力,就能让机器人记住完整作业流程、自主识别工序偏差、遇到干扰自主回退修正,有望推动具身智能从短时零散操作,迈向连续长流程自主作业,对工厂柔性装配、巡检运维等场景具备重要价值。

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有