7 月 15 日,小米正式推出 380 亿参数自回归具身世界基础模型 Xiaomi-Robotics-U0 并全量开源,配套开放项目官网、技术报告、模型权重,覆盖完整使用与复现链路。该模型实现行业首创技术突破,打破过往世界模型仅依托机器人轨迹数据训练的局限,把图像、视频生成底层基座和具身物理世界建模整合进单一自回归框架,一套模型同时承载多视角场景生成、可控具身场景迁移、机器人交互视频预测、通用文生图、指令式图像编辑五大能力。
模型划分五大可控维度重构场景,包含工作空间、背景、前景杂物、目标物体、光照,可单独调整任一要素,全程锁定机器人操作姿态不变,仅凭文本指令就能生成海量差异化仿真场景,高效补齐行业稀缺的多样化训练素材。在交互视频生成层面,输入初始画面与操作指令即可推演完整机器人作业时序,支持多视角同步预测,兼顾动作连贯度与物理动力学规则,零样本适配各类陌生场景。除此之外,模型保留通用视觉生成能力,既能高保真跨风格文生图,也能实现结构性图像编辑,仅修改指令相关物体,保留场景原有布局,打通互联网海量视觉知识向具身机器人迁移的通道。
多项权威评测证明 Xiaomi-Robotics-U0 综合性能领先,人工对比测试中,场景生成、场景迁移效果全面优于 GPT-Image 2.0;在清华、北大联合搭建的 World Arena 全品类具身视频生成榜单拿下总分第一,可控性、指令跟随、交互真实度、多视图一致性四项细分指标均斩获高分。核心差距在于小米统一了多视图几何逻辑,竞品容易出现跨画面物体错位、空间扭曲缺陷,而该模型输出画面空间结构稳定,场景迁移鲁棒性更强。
团队在毛巾折叠、耳机收纳、多物品装箱等高难度长时序真机任务完成验证,在陌生光照、全新背景等干扰环境下,采用该模型生成扩充数据训练机器人,任务完成进度平均提升 26.3%,面对反光、彩色强光等极端视觉干扰也可自主校正,不会出现任务卡死。
推理效率层面,小米自研 FlashAR + 加速方案,拓展原生 FlashAR 加速能力适配图像生成任务,融合轻量化后处理优化与 vLLM 分页缓存、对角并行解码调度。同等 1024×1024 分辨率图像,单张生成耗时从 450.77 秒降至 5.44 秒,整体生成效率最高提升 82.9 倍,兼顾高质量生成效果与工程落地实时性,适配大规模仿真数据批量产出需求。
模型采用 IBQ 图像分词器统一多模态表征,依靠标准多模态 Next Token Prediction 完成训练,将通用视觉大模型积累的海量常识、物体动力学知识融入具身世界模型,不再局限于少量机器人真机轨迹微调,为行业搭建低成本、可规模化的数据生成引擎提供全新路线。
同期小米披露工业机器人落地进展,年初机器人进驻小米汽车工厂自攻螺母工位,经过一季度迭代,双侧工位作业成功率提升至 98%;中控台盖板分拣、料箱折叠回收工序作业成功率均稳定突破 90%。
Xiaomi-Robotics-U0 的开源发布,标志具身世界模型进入统一合成全新阶段,依托通用视觉生成能力海量扩充仿真训练数据,有效缓解行业真机数据稀缺难题,为通用人形机器人规模化训练提供高效、低成本的数据底座。