资本持续加码具身智能赛道,各类评测榜单层出不穷,“行业第一” 成为各家企业宣传标配,但榜单背后的真实性、公允度饱受行业质疑,刷题、话术包装、商务资源置换等操作,让榜单失去客观参考价值。今年 6 月初,千寻智能 Spirit v1.6 凭借 1918 分登顶 RoboArena 榜单,一度超越英伟达 Cosmos3,企业同步官宣近 50 亿元密集融资,引发行业热议。但大量业内观测者提出质疑,该模型 310 条评测记录中 72% 评分来自两家单一账号,存在集中刷分嫌疑。后续 RoboArena 官方回溯核查,移除存疑数据并更新榜单,Spirit v1.6 直接从榜单除名,该事件也揭开了具身榜单行业乱象的一角。
即便出现典型刷榜案例,行业企业争抢榜单名次的热度并未降温。近半年星动纪元、原力灵机、智元、跨维等多家头部厂商,均对外发布自身拿下榜单第一的宣传物料,且各家 “第一” 分属不同评测赛道。当前行业技术路线尚未统一,真机作业普遍成功率仅五成左右,外部投资、产业机构缺少直观技术评判依据,只能依靠榜单作为参考标尺;但榜单发布主体混杂,高校学术基准、媒体商业榜单、咨询产业榜单并行,评测标准不统一,部分榜单绑定商务合作,参考价值大打折扣。多位赛道投资人表示,榜单仅能作为辅助参考,国资、地方引导基金更看重榜单头衔用于书面报告,市场化投资机构则不会仅凭排名判断企业技术实力;也有投资人认为,在信息高度不对称的早期行业,榜单仍可提供横向对比基础。
目前市面活跃的具身智能评测榜单超 20 个,按评测维度分为三类,三类榜单定位互不替代,不存在统一全能评测标准。第一类为 VLA 操作综合榜,以 RoboChallenge Table30、MolmoSpaces 为代表,侧重机器人真实任务实操成功率;第二类是世界模型推演榜单,World Arena、WorldModelBench 为主,考核模型对物理世界的预判推演能力,不考核硬件执行水平;第三类专项基准榜,包含 RoboTwin 2.0、LIBERO、CALVIN 等,针对双臂协同、虚实迁移等极限场景,暴露模型细分短板。
榜单赛道拆分带来宣传漏洞,同一份榜单内多条子赛道会诞生多个 “第一”,对外宣传时常省略细分赛道限定词。World Arena 榜单中,智元 GE-Sim 2.0 拿下感知动作赛道第一,跨维 DSCFuncWorld 登顶数据引擎赛道,两家企业对外均简化表述为 “登顶 World Arena”,普通受众难以分辨赛道差异。同时行业榜首更迭速度远超大语言模型榜单,RoboChallenge Table30 半年内四次更换榜首,主流大模型榜单榜首通常可稳定数月。业内从业者解释,物理真机测试存在天然随机性,光照、机械公差、物体摆放都会造成 3 至 5 个百分点分数浮动;且多数榜单测试任务完全公开,企业可定向采集对应数据微调模型,榜单榜首 “保质期” 仅一周左右。更有企业将真机学术榜单与媒体商业榜单合并宣传,刻意抹平两者含金量差距,误导外界认知。
行业内已形成一套成熟的 “造第一” 潜规则,主要分为三种操作手段,且经常叠加使用。第一种是低成本话术包装,只截取细分赛道单项名次,删减限定条件对外宣传,数据本身无造假,但刻意放大排名覆盖范围;第二种是定向刷题与机制漏洞刷分,一方面企业针对公开榜单任务定向训练模型,另一方面利用分布式评测平台规则漏洞,多账号集中评测抬高自身分数、压低竞品数据,千寻 Spirit v1.6 事件便是典型,后续平台补充第三方评测、可疑账号筛查规则填补漏洞;第三种是隐蔽的资源置换,媒体、咨询类榜单可通过商务合作调整排名,与学术基准榜单捆绑宣传,混淆榜单公信力。这类操作门槛隐蔽,缺少专业技术储备的从业者很难识别。
业内多数从业者已不再单纯依靠榜单评判模型实力,核心原因是榜单可人为干预,且物理世界不存在统一量化标尺,如同擅长炒菜与擅长凉拌的机器人无法简单对比优劣。但榜单仍具备基础参考价值,具备三类特征的榜单可信度更高:一是分项数据完整披露,不单一公布总分,清晰展示各细分任务完成情况;二是由独立第三方全程管控评测流程,设置光照突变、杂物干扰等反刷题扰动条件,禁止模型定向微调;三是区分榜单更新逻辑,真机长周期评测榜单更新慢、动态对战类榜单更新快,不能单纯以更新频率判断含金量。
行业扎堆刷榜本质是资本周期下的短期营销行为,现阶段具身智能企业缺少稳定营收、批量交付订单等硬核经营指标,只能依靠榜单头衔提升估值、获取产业资源。长期来看,随着行业成熟,市场评判标准会切换至整机交付量、落地客户、持续盈利等实体经营指标,榜单热度自然回落。相比热衷刷榜造势的企业,深耕产线落地、持续积累真实场景数据的厂商,更具备长期产业竞争力。