首页
资讯
品牌
机库
测评
选购
租赁
组件
算力
开发
社区
活动
赛事
视频
人物
展会
排行
------
反馈
行业动态
具身大模型的 "榜单狂欢"
2026-08-18 22:07:14   具身之家综合

  "拿下具身世界模型第一"" 登顶具身智能榜单 ""具身大模型登顶国际评测公开排行榜"—— 搜索近期的具身大模型新闻,满屏的 "第一" 和 "登顶" 跃入眼帘。8 月 11 日,越疆科技宣布其空弈 DobotWAM 具身大模型在面向复杂遮挡机器人抓取的 UNOBench Challenge 两大赛道同时登顶;不到半个月前,智元的具身原生全模态大模型 WITA-Omni Preview 在 DailyOmni 榜单上登上榜首。拉长时间轴,极佳视界的 GigaWorld-1、中科第五纪的 FlowWAM、千寻智能的 Spirit v1.6 相继在 WorldArena、RoboArena 等榜单中宣称全球第一。在这个资本最密集的赛道,榜单似乎已经变得不够用了。

  当几乎所有头部公司都手握至少一个 "第一" 时,这些榜单究竟在衡量什么?记者调研发现,当前具身大模型榜单数量已超 20 个,发起方涵盖清华大学、北京大学、普林斯顿大学、斯坦福大学等顶尖高校,美国艾伦 AI 研究院、上海 AI 实验室等研究机构,以及英伟达等企业,但业内公认的权威标准尚未形成。安邦智库宏观经济研究中心助理研究员赵至江指出,具身智能正处于技术探索与产业验证的早期阶段,技术路线尚未完全收敛,统一的行业评价标准难以形成;与此同时,资本市场对具身智能保持高度关注,企业需要通过测试成绩、演示视频和技术指标证明自身领先优势,客观上推动了部分指标包装和营销放大现象。

  要理解榜单的含金量差异,首先需要厘清具身大模型与通用大模型评测的本质区别。近一两年来,随着供应链成熟,造一台机器人已非难事,行业竞争从 "拼本体" 转向 "拼大脑",而这个 "大脑" 就是具身大模型。通用大模型领域指标清晰、评测成熟,已形成若干公认权威榜单;但具身大模型高度依赖配套的机器人本体、执行器与仿真环境,分数无法脱离硬件单独成立。天使投资人、资深人工智能专家郭涛表示,厂商可以通过调整机械参数、优化仿真环境定向提分,纯技术参考价值弱于通用大模型榜单。

  从评测环境来看,当前榜单主要分为仿真任务榜单与真机测试榜单。中国社会科学院大学数字中国研究院特聘研究员刘兴亮介绍,仿真任务榜单数量最多,如 LIBERO、RoboTwin、ManiSkill 等,它们标准化、低成本、容易复现,特别适合算法横向比较;而真机评测需要匹配硬件和场地,耗时长、成本高,因此真机测试榜单十分稀缺。一名业内人士坦言,不同于通用大模型以数字形式输入输出、可线上进行,具身大模型真机评测的门槛要高得多。从考察能力范围来看,榜单又可分为综合能力榜单和专项能力榜单,前者如同对模型能力的 "全面体检",后者侧重特定能力或极端场景表现。当榜单足够多、赛道足够细分,企业总能找到某个维度让模型登顶。

  那么,一个榜单究竟有没有含金量?刘兴亮提出了四个判断标准:题目是否公开透明,测试集是否与训练集隔离,结果能否被第三方复现,能否经过真实世界的验证。然而在现实中,这些标准往往难以全部满足。更尴尬的是,仿真环境中的 "学霸" 到了真实世界,往往变成 "学渣"——"榜单上的高手,实践中的矮子" 已成为行业普遍现象。

  造成这一鸿沟的原因是多方面的。郭涛指出,许多榜单测试场景单一、任务边界固定,无法覆盖工业、家庭等多元化真实工况,一家公司在某个榜单得分高,可能只是在该特定任务上表现优异,而非整体技术实力领先。更关键的是,大多数榜单基于仿真环境,与真机实测存在不可忽视的差距。"在仿真环境里,光照可以标准化,摩擦系数可以设定,摄像机不会突然被人挡住。但进入工厂、商场和家庭以后,桌子可能挪了两厘米,袋子会变形,玻璃会反光,人可能突然伸手过来,网络还可能延迟。" 刘兴亮说,机器人面对的是一个开放、不确定且持续变化的物理世界,仿真测试结果更多是一种理想状态。以被誉为具身智能领域 "珠峰级" 评测的 RoboDojo 为例,该榜单采取 "仿真 + 真机" 双榜单机制,设计了 42 个仿真任务和 18 个真实机器人任务,真实世界部分表现最好的模型总体成功率仅为 12.8%,折射出机器人落地的巨大鸿沟。

  此外,部分企业存在定向 "刷榜" 行为,人为抬高分数。郭涛透露,有的针对仿真榜单进行 "题库式刷分",提前获取测试任务样本,针对固定物体、固定动作场景专项微调模型权重,刻意降低陌生场景权重分配;有的针对真机榜单进行硬件调优,锁定专用测试样机,调试关节阻尼、运动速度适配榜单任务,规避通用工况的严苛约束;个别厂商还可能利用自己注册的评测账号不断测试、刷新评分。这些行为进一步稀释了榜单的参考价值。

  破解榜单的 "虚假繁荣",关键不是取消榜单,而是把考试从 "做题" 变成 "实战"。刘兴亮认为,具身大模型榜单需从三方面改进:一是评测标准要统一,现有评测在环境设置、硬件配置、测试条件等方面差异较大,不同模型间很难公平对比,唯有制定更统一的标准,才能提高结果的可复现性;二是引入盲测,测试任务不能全部提前公开,最终排名应由隐藏测试集、陌生物体、陌生场景决定,以此防 "刷榜"、真正测试泛化能力;三是将仿真测试与真机测试结合起来,验证机器人在物理世界的可靠性。目前一些榜单比赛已开始采用 "仿真初赛 + 真机决赛" 的形式,正是这一方向的探索。

  从更长远的视角看,评价体系的演进与产业发展阶段密切相关。赵至江表示,目前具身智能还处于发展早期,评价更多围绕单项能力、实验性能、技术参数展开,目的在于证明技术路线是否成立;随着产业进入应用阶段,评价体系会逐渐转向综合能力,由技术展示驱动转向产业价值驱动。"一个成熟的产业,通常不会依赖技术性的榜单作为评价标准,而是形成由行业标准、第三方测试和市场反馈共同构成的评价体系。" 赵至江判断,具身智能距离这一阶段还有较长过程,三到五年甚至更长时间都有可能。在这场 "榜单狂欢" 背后,真正值得追问的或许不是谁拿了多少个第一,而是谁的机器人能在真实世界里站稳脚跟。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有