7月15日,小米正式发布并全量开源Xiaomi-Robotics-U0,一款参数规模达380亿的多模态自回归具身生成基础模型。作为全球具身领域首个可统一覆盖四类核心生成任务的AI模型,该成果打破行业技术壁垒,打通机器人图像、视频数据生成与编辑全链路,凭借统一架构、高效生成、高保真仿真的核心优势,解决了具身智能产业长期存在的数据稀缺、模型割裂、仿真失真等痛点,为机器人技术迭代与规模化落地搭建起全新的通用算力底座。
长期以来,数据短板是制约具身智能发展的核心瓶颈。传统机器人研发高度依赖实景采集数据,不仅耗时耗力、成本高昂,还难以覆盖高危、极端、小众等长尾场景,导致机器人训练样本单一、场景适配性差。同时,行业现有模型普遍存在功能割裂问题,场景生成、轨迹模拟、视频编辑等任务需依靠独立模型完成,兼容性差、迭代效率低,且多数仿真数据存在几何结构不一致、物理逻辑失真等问题,无法满足高阶智能训练需求,极大限制了机器人自主决策与实景作业能力的提升。
Xiaomi-Robotics-U0的问世,彻底重构了具身智能的数据生产与模型训练体系。该模型创新性地将具身世界建模、多模态内容生成、场景动态模拟等能力整合至单一自回归架构,实现了模型一体化、任务全覆盖的技术突破。依托强大的算法能力,模型可在保障空间几何一致性与物理真实性的前提下,对现有真机数据进行智能增强,支持替换场景物体、调整光照环境、叠加动态干扰等操作,无需重复实地采集,大幅降低数据迭代成本。
针对实景难以复刻的特殊场景,U0模型具备从零构建全新仿真场景的能力,可精准生成灾害环境、高空作业、复杂工业工况等各类高危、极限场景数据,全方位补齐机器人训练的数据盲区。相较于传统方案,该模型的数据生成效率大幅提升,极大丰富了训练样本的多样性,让机器人能够学习更多复杂场景的作业逻辑,有效提升动态环境适配、自主避障、精细操作等核心能力,解决了传统机器人“见过的场景会做、没见过的场景失灵”的行业通病。
开源开放是本次技术发布的核心亮点之一。小米全面开放模型权重与代码体系,面向全球开发者、科研机构与企业共享核心技术成果,打破了头部企业的技术壁垒。开源生态的搭建,能够吸引全行业力量参与模型优化、场景适配与功能拓展,加速算法迭代与技术创新,推动具身智能技术从企业自研走向行业共建,大幅降低中小团队的机器人研发门槛,激活整个产业的创新活力。
从产业价值来看,Xiaomi-Robotics-U0不仅是小米机器人技术自研的重大突破,更为国内具身智能产业提供了标准化、高效率的基础模型底座。它成功破解了数据短缺、模型碎片化、迭代效率低等核心难题,构建起低成本、高效率、全覆盖的机器人训练体系。未来,依托该模型的持续迭代与生态普及,将进一步加速人形机器人、服务机器人、工业智能设备的智能化升级,推动具身智能技术快速落地千行百业,助力国内AI机器人产业迈入规模化、高质量发展的全新阶段。