清华大学于超教授团队联合正行创新、无问芯穹正式发布并开源 Harness VLA,首次将数字智能领域广泛应用的 Harness Layer 引入具身智能体系。该方案无需微调更新 VLA 模型权重,保持底层模型冻结运行,依托 Agentic Planner 统一管理模型调用、任务执行与失败恢复,推动机器人技术路线从单一端到端模型,转向模型能力与系统调度协同配合的新架构,有效提升复杂扰动场景下的泛化能力。在 LIBERO-Pro 扰动测试中,Harness VLA 任务成功率达到 82.4%,大幅领先 Pi_RLinf、NVIDIA Cap-X、Berkeley RATS 等主流方案。同时 Harness 属于通用系统框架,不仅适配各类 VLA 模型,也可对接 WAM 等具身基础模型,具备良好跨模型兼容能力。
当前主流端到端 VLA 模型在标准测试环境中表现优异,但一旦出现物体位置变动、目标指令重定向等环境扰动,性能会出现断崖式下滑。究其根源,端到端架构将感知、规划、动作控制全部交由模型承担,难以应对分布外场景变化。行业以往思路倾向于扩大模型规模、扩充数据集,试图依靠模型本身提升泛化性。而 Harness VLA 借鉴 Coding Agent 的发展经验,不再单纯追求训练更强的底层模型,而是新增一层执行调度层,优化模型的调用方式,探索出一条差异化技术路径。
整套架构将任务拆解为两类执行原语:VLA_ACT Primitive 负责抓取、按压等难以解析建模的接触密集操作,底层 VLA 模型保持冻结,专注发挥自身局部操作优势;Analytic Primitives 承担空间移动、位姿调整、释放物体等确定性非接触任务。核心的 Agentic Planner 持续学习两类原语适用边界,自主判断不同阶段采用何种执行方式,并且在操作失败后重新调整机器人姿态、位置再次尝试。系统划分探索自举与部署评估两大阶段,在交互试错中沉淀任务专属记忆与全局通用经验,面对新场景扰动时,依托历史经验动态规划执行流程。
研究团队在 LIBERO-Pro、RoboCasa365、RoboTwin C2R 三大测试基准开展完整验证,覆盖空间扰动、长程家庭任务、双臂跨场景迁移等典型工况。实验结果显示,无论少样本还是零样本场景,Harness VLA 相较纯端到端 VLA 基线均实现显著提升。方案性能提升的核心逻辑有三点:智能体重新绑定任务目标,解决模型混淆操作对象的问题;规划器为 VLA 创造合适的初始执行状态,减少无关环境干扰;通过原语分工剥离可解析的移动任务,让 VLA 聚焦擅长的精细接触操作。
Harness VLA 融合 VLA、智能体、Code as Policy 三条技术路线的优势,补齐各自短板。它将 VLA 收缩至局部接触操作场景,利用智能体完成高层规划、失败重试;同时弥补纯解析式原语难以处理复杂物理交互的缺陷。该成果作为 RPent 开源生态的核心项目对外开放,RPent 旨在打造面向持续进化物理智能体的基础设施,承接此前 RLinf 大规模强化学习训练底座,形成覆盖训练、部署全流程的开源技术体系。
这项成果预示具身智能范式正在迎来关键转变,行业竞争不再只局限于训练更大规模的基础模型,模型之上的调度、记忆、执行组织系统价值凸显。如同 Harness Layer 推动代码智能体快速发展,未来具身智能或将进入新发展阶段:基础模型负责生成技能,Harness 类系统负责合理释放、组合、复用技能,推动机器人具备长程自主执行、故障自恢复能力,加速物理 AI 从实验室走向真实产业场景。