具身智能领域模型迭代迅速,行业却一直缺乏统一的评测标准。据澎湃科技不完全统计,截至 2026 年 8 月 20 日,全球各类具身大模型榜单已超过 20 个,另据公开资料梳理,其中由中国高校、科研机构或企业牵头联合发布的包括具身模型赛事型、论文型等各类评测已至少超过 11 个。围绕 "如何衡量一个具身模型的真实能力",行业正在分化出两条并行推进的路线:一端是高保真仿真基准,一端是真实机器人测试。但问题依然存在:仿真评测成本低、可复现,却与真实物理世界存在落差;真机评测贴近现实,又受制于硬件成本与场景碎片化。
仿真路线上的最新一例,是由高校、科研机构、开源社区、机器人企业和模型公司等多方联合共建的常态化仿真评测平台 RoboColiseum 正式上线。该平台基于高保真仿真环境构建,项目负责人吴墨表示平台发起的初衷是为全球的科研机构、高校和模型企业的开发者提供一个 7×24 小时开放的高保真仿真评测平台,帮助模型去验证性能、更好地迭代。虽然市场上已经有很多评测平台,但在吴墨看来很多评测未能满足具身行业的需求,"行业发展极快,模型能力快速提升后在榜单上的得分很快趋于接近,如果评测基准不能及时迭代那就无法有效区分模型之间的差距。" 吴墨本科毕业于伊利诺伊大学香槟分校,硕士毕业于斯坦福大学,此前有 8 年智能体仿真和高保真场景重建相关领域研究和项目落地经验。
RoboColiseum 在评测体系方面围绕四个维度推出了 4 类能力子榜、78 个高保真仿真评测任务,四个维度分别是指令跟随、空间理解、扰动适应和通用操作。吴墨解释:"一个机器人在真实世界完成一系列任务,需要先理解指令,再理解空间关系,在执行中抵抗扰动,最后组合原子技能完成操作。" 此外平台提供 ACoT-VLA、π0、π0.5、GR00T 等基线模型的训练代码和权重,开发者可自行复现训练和评测过程、核验基线成绩并开展模型对比与后续研究。在易用性方面 RoboColiseum 将复杂的环境配置与评测流程封装为自动化服务,开发者最快 30 分钟即可完成仿真评测,自今年 6 月开放内测以来已有海内外 40 多支队伍在平台开展模型训练与评测。
据测评,相同模型在 RoboColiseum 仿真环境和真机测试中的任务成功率差异小于 10%,但仿真环境下的高分与实际落地效果之间的落差一直是业内关注的焦点问题之一。相关人士坦言许多仿真评测基准并未进行系统的仿真-真机对照实验,其成绩未必能真实反映模型在现实世界中的表现。天使投资人、资深人工智能专家郭涛进一步解释,这类落差主要源于仿真环境和真实物理世界存在不可弥合的现实鸿沟。在仿真环境维度,虚拟场景可以消除地面扰动、光照变化、零部件磨损等现实干扰,企业还可以针对榜单任务定向调试模型,一旦迁移到真实机器人,本体硬件误差、传感器噪声、环境不确定因素会全部显现,仿真训练的模型会出现性能衰减。在评测机制维度,多数榜单允许企业使用自有硬件,高分是算法、本体、驱动协同的综合结果,算法的通用能力无法单独剥离,跑分结果很难复现在其他机器人硬件之上。在商业化场景维度,仿真任务大多是标准化简短动作,产业现场需要长时间稳定运行、容错抗干扰,榜单任务并不覆盖这类真实诉求,仿真跑分高不等于可以直接完成产业交付。
郭涛进一步分析认为,具身智能当下评测维度纷繁,不同榜单侧重仿真、真机、单项动作或者综合任务,各家牵头机构的测试集、评价标准各不相同,造成榜单含金量参差不齐。在参考价值层面,榜单可以横向对比同一套硬件条件下的算法迭代进度,适合企业做内部技术迭代标尺,但不能直接等同于产业落地能力,部分榜单更多承担品牌传播作用。相较于大语言模型,具身智能受硬件本体约束极强,很难做到完全跨设备统一测试。郭涛认为即便是未来具身也很难复刻大模型那种广泛通用的单一权威榜单,行业更可能分化出两类评测,一类是仿真环境标准化基准用来迭代算法能力,另一类是基于多品牌真机的产业场景测试集更加贴近真实业务需求,两套体系并行完成技术评估。
针对仿真评测的局限性,基于真实世界的真机评测体系也在同步推进。2025 年机器人公司原力灵机(Dexmal)与 Hugging Face 发起 RoboChallenge 在线真机仿真评测平台,主要测试 VLA(视觉 — 语言 — 动作)模型能否在真实机器人上完成操作任务,该平台的基本做法是由参测团队提交或远程连接子集的模型,由平台在统一机器人、摄像头、场景布置和评分规则下运行模型,减少各团队自行测试造成的条件差异。2026 年 8 月 12 日香港大学多媒体实验室(MMlab)宣布推出结合模拟环境与真实世界机械人操作的具身人工智能统一评测基准平台 ——RoboDojo,该项目由港大计算与数据科学学院副院长罗平教授与其博士研究生陈天行共同发起,汇聚了包括加州大学柏克莱分校及清华大学在内全球近 20 所顶尖大学与科研机构共同参与。香港大学指出,现有的评测方法大多局限在模拟环境中,或者因为采用不同的硬件配置、测试条件和评分标准导致不同模型之间难以进行公平且标准化的比较,即使机器人在示范中表现出色仍然未必能真实反映其在复杂多变的现实场景中持续且稳定地执行任务的能力。
郭涛进一步分析认为,类似 RoboChallenge 等这类第三方平台及部分学术顶会虽然已经搭建了标准化真机盲测与竞赛,但大多局限在桌面操作场景,尚不能适配人形整机与工业复杂环境。真机评测硬件投入成本高,不同本体的机械偏差会影响评测公平,同时家庭、工厂等场景任务高度碎片化,很难打造一套通用测试标准。郭涛预计未来两到三年将优先落地服务研发的学术真机基准,随着机器人量产成熟逐步落地,行业大概率走向学术基准、产业场景评测两套体系并行的格局。吴墨则更乐观,他认为随着 sim2real gap(仿真到现实的迁移)的不断缩小,仿真评测低成本、大规模、高泛化的优势会愈发明显,仿真评测的比重会逐渐增大甚至不需要真机评测,目前基于 AIGC 的场景重建和生成技术也发展迅速,可以在仿真环境中快速还原各种产业的真实场景,因此仿真不仅仅可以用于基座模型评测更能够快速支持大规模的产业场景评测,平台榜单将持续根据模型迭代节奏进行维度和任务的更新,在后续逐步加入机器人精细操作和长程任务等新增评测能力。