具身智能行业正处于由 “静态数据模仿” 迈向 “真实世界经验驱动” 的关键拐点。机器人不再局限于复刻已有动作,亟需具备在线持续学习、自主迭代进化的能力。然而强化学习流程繁琐、软硬件组件异构、算力资源多样、真机在线学习难以规模化等痛点,持续阻碍具身智能落地。由无问芯穹联合清华大学共同研发,全球首个面向具身智能持续进化的大规模强化学习基础设施 RLinf 正式升级至 v0.3 版本,打造支撑物理智能长期迭代的新一代进化底座。
RLinf v0.1、v0.2 先后完成强化学习系统抽象、真实世界在线学习底座搭建。全新 v0.3 升级为一站式具身智能开发平台,首次完整打通数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测、真机部署全链路,建成从仿真训练、机器人在线学习到持续优化迭代的统一闭环,不仅能够高效训练机器人策略,更支撑智能体在真实环境中长期自主进化。新版本围绕模型生态、算法体系、真机适配、仿真环境、系统基座五大维度全面升级,降低具身智能研发门槛,提升训练效率与部署灵活性,同时持续拓宽开源生态边界,坚守训练流程可复现这一核心设计目标,并且已与百度智能云等多家云厂商完成协同上线。
在模型生态层面,RLinf v0.3 新增 6 款主流具身模型原生支持,覆盖世界模型、VLA 视觉语言动作模型,并搭载系统级加速方案,包含 Dexbotic DM0、DreamZero、GR00T-N1.6/N1.7、ABot-M0、StarVLA、LingBot-VLA,依托 FSDP2、CUDA Graph 等优化手段,部分工作流推理吞吐最高提升近 4 倍,兼容主流具身模型微调与策略生成需求。
算法体系实现模仿学习、仿真强化学习、真机强化学习全覆盖,多项新增算法在真机任务中取得 SOTA 效果。真机强化学习方向拓展 DSRL 算法适配 Pi0.5 模型,新增 RECAP、SAC-Flow 训练流水线;仿真强化学习完善 Async PPO 框架,新增 D4RL 离线 IQL 训练支持;人在环学习板块补充 DAgger、HG-DAgger 真机在线模仿学习方案,适配 LIBERO、RoboTwin、真机抓取放置等大量场景,丰富人机协同训练路径。
真机链路实现重大突破,完整打通数据采集、SFT 微调、强化学习到真机部署闭环。平台新增空间鼠标、VR、GELLO 三类遥操作采集方式,支持 LeRobot 标准数据集格式,打通 Pi0 真机 SFT 部署链路;新增 Franka 双臂、GimArm、DOS-W1 三大真机硬件平台,兼容 Franka DexHand 灵巧手、Robotiq 夹爪等末端执行器与配套视觉相机,同时支持奖励模型训练数据采集,大幅降低真机端算法验证难度。
仿真环境进一步扩容,新增 Genesis、Polaris、RoboVerse 三大仿真器,升级 Behavior、Libero+/LiberoPro、Embodichain、IsaacLab 等环境适配,补充 RoboCasa 抽屉操作等大量强化学习示例,拓展仿真训练场景丰富度,缩小仿真与现实之间的虚实鸿沟。
底层系统基座持续夯实,新增 Reward Model、Value Model 核心组件,集成 SGLang 推理服务模块;重构环境执行架构,解除环境与推演工作进程绑定,有效提升 GPU 利用率。同时引入 torch.compile、推演与训练任务重叠、分级权重同步、FSDP 全卸载等性能优化手段,修复显存泄漏等关键缺陷。平台实现异构算力广泛兼容,原生支持昇腾 Ascend、AMD ROCm、Musa 等国产算力与通用 CUDA 架构,达成跨机器人本体、跨模型、跨仿真环境、跨计算硬件的统一训练能力。除此之外,版本同步面向智能体强化学习拓展能力,新增 AgentLightning、Megatron-Bridge、SearchR1 等组件,赋能 Agentic AI 研发。
自开源以来,RLinf 影响力持续扩大,GitHub 收获 4100+ Stars、600+ Forks、100 多位贡献者,被 Isaac Lab 收录为首款具身大模型专用训练引擎。项目相关成果登上 NVIDIA GTC 2026,斩获 EAI-100 年度十大突破奖,入选 PyTorch 生态、蚂蚁开源榜单。作为开放型基础设施,RLinf v0.3 为学术界、产业界提供标准化、可复现、端到端的强化学习工具链,助力行业解决真机持续进化难题,加速具身智能从仿真实验室走向各类真实作业场景。