2026 年上半年,国内具身智能赛道迎来资本盛宴,全年 322 起融资事件,融资总规模高达 935 亿元。火热资金涌入赛道的同时,一个高频词汇反复出现在企业宣传稿中 ——“全球第一”。据不完全统计,当前行业内活跃的各类具身智能评测榜单已经超过 20 个,几乎每周都有企业官宣拿下榜单榜首。星动纪元、智元、跨维、千寻智能、极佳视界、鹿明等多家企业,陆续发布登顶国际榜单的战报。RoboChallenge Table30 榜首半年之内四次易主,World Arena 同一阶段甚至出现多家企业宣称拿到 “第一” 的现象。
颇具讽刺意味的是,各类榜单产出 “第一名” 的速度,已经超越机器人技术迭代速度。不少模型正式发布一周之内便宣告登顶榜单,榜单更新频率快于企业产品迭代周期。海量 “第一” 集中涌现,催生行业普遍困惑:榜单排名持续通胀,这些光鲜头衔背后究竟具备多少技术含金量?谁在制造层出不穷的行业榜首?当榜单营销盖过技术研发本身,处于产业化前夜的具身智能赛道,正在经历一场剥离泡沫、走向务实的成人礼。
2026 年 6 月初,千寻智能对外发布消息,自研具身基座模型 Spirit v1.6 登顶 RoboArena 榜单综合得分第一,力压英伟达 Cosmos3、Physical Intelligence Pi0.5,宣称打破硅谷企业长期霸榜格局,并将 RoboArena 称作 “具身智能奥林匹克”。官宣技术突破的同一天,企业同步宣布完成 15 亿元 A + 轮融资,短短三个月累计融资规模接近 50 亿元。技术突破叠加资本加持,构成当下具身智能赛道最标准的商业叙事。
这场看似完美的技术胜利,短短数日便遭到业内质疑。行业人士梳理 RoboArena 公开评测记录发现,310 条有效评测数据中,72% 的分数来源于两个注册账号。账号 ECUST Robot Lab 针对 Spirit v1.6 开展 179 次评测,测算胜率高达 97%;另一账号 Robotics Lab 完成 45 次评测,胜率 86.7%。与之形成鲜明对比,英伟达使用同款模型独立测试 21 次,最终胜率为 0。进一步追溯可以发现,两个高频评测账号集中在 5 月底注册,账号绝大多数评测对象均为千寻智能模型。事件发酵后,RoboArena 官方启动回溯调查,剔除全部可疑评测数据,Spirit v1.6 随之从榜单主榜消失。
这起事件如同窗口,完整照见具身智能赛道的榜单水分。近半年,“铁打的榜单,流水的第一” 成为常态。2 月,原力灵机 DM0 宣称拿下 RoboChallenge 真机评测双项第一;3 月,极佳视界 GigaWorld-1 登顶 WorldArena 阶段性榜单;5 月,星动纪元 Era0 拿下 RoboChallenge Table30 榜首,同月智元 GE-Sim 2.0 登上 World Arena Track1 第一名;6 月,跨维智能 DSCFuncWorld 登顶 World Arena Track2。World Arena 榜单还一度出现多家企业同时宣称拿下不同维度 “全球第一” 的局面。每一个头衔都附有榜单作为背书,各家榜单设置独立赛道与评判标准,“全球第一” 逐步变成流水线批量产出的营销素材。
榜单狂欢背后,是一条完整清晰的利益链条。对于创业公司而言,榜单榜首从来不止是技术荣誉,更是实用的商业工具。当前具身智能赛道技术路线尚未收敛,商业化落地普遍不足,投资人缺少直观、统一的量化指标评估企业价值,榜单排名顺势成为简单直接的估值锚点。一个 “全球第一” 的宣传头衔,能够直接推动企业估值提升数亿元,更是新一轮融资的核心叙事素材。千寻智能、星动纪元均选择同步官宣榜单成绩与融资进展,榜单造势、提升估值、完成交割,已经成为行业公开通行的操作。
除去融资用途,榜单排名也是面向政府、产业客户与大众市场成本最低的宣传抓手。各家企业都在讲述模型泛化能力、机器人自主作业的技术故事,缺少通用评判标准的环境下,“全球第一” 拥有极强传播穿透力。旺盛的市场需求,催生榜单评测商业化供给。目前市面上具身智能榜单大致分为三类:VLA 操作综合榜单,侧重机器人实操任务完成能力;世界模型榜单,评估 AI 对物理世界推演预测水平;专项基准榜单,针对极端场景单点能力开展测试。
风险在于,部分榜单本身带有商业属性,评测标准不对外公开、规则存在人为干预空间,可与商务合作深度绑定。智源研究院院长王仲远在智源大会上直言,当下各类榜单眼花缭乱,评测结果并不完全可信。即便是拥有高校、科技巨头背书、看似中立的评测平台,依旧存在大量可操作空间。RoboArena 暴露的便是分布式评测机制漏洞,平台允许任意机构注册账号担任评测者,相当于考生同时拥有考官权限。
封闭式榜单同样存在明显短板,大量企业针对榜单任务定向优化模型,演变为具身智能行业的 “应试教育”。自变量算法举办的具身智能黑客松赛事中,参赛团队针对公开 A 榜固定场景、物品摆放方式反复调试模型,取得靠前排名;进入包含全新物体、环境布局改变的盲测 B 榜之后,模型性能大幅下滑。针对固定考题打磨出的高分,与具身智能追求的复杂环境泛化能力背道而驰。企业需要榜单助力融资,资本依靠榜单完善投资逻辑,所有人默契参与这场狂欢,真实技术能力与场景落地价值却被持续忽视。
刷榜乱象只是表象,根源在于整个赛道缺少统一公认的价值标尺,行业处于蒙眼狂奔的阶段。科技产业发展历史中,所有新兴赛道在概念爆发阶段,都会经历一段缺少标准化评价体系的野蛮生长期。新能源汽车拥有续航、加速、安全分级等统一指标;智能手机拥有芯片跑分、影像标准化评测;通用大模型形成 MMLU、GSM8K 等全球通用基准测试,指标公开透明、结果可复现,很难长期依靠数据修饰制造假象。
但具身智能赛道至今没能形成统一评测基准。赛道横跨感知、决策、运动控制、人机交互,不同企业技术路线差异巨大。宇树科技侧重硬件本体与步态控制;千寻智能、星动纪元聚焦 VLA 模型与世界模型;擎朗智能深耕服务业场景落地;智元机器人走全栈自研路线。运动控制优势企业模型能力可能偏弱,仿真跑分领先的团队未必拥有成熟真机,深耕场景落地的企业通用算法能力存在短板,不同路线企业很难放在同一榜单横向对比。
赛道迭代节奏持续加速,评判重心逐年迁移。2024 年行业比拼机器人自由度、静态行走稳定性;2025 年竞争焦点转向 VLA 模型抓取成功率;进入 2026 年,行业重心转向世界模型预测、无远程操控连续作业、异常场景自主恢复等能力。同时,赛道面临一个天然难题:具身智能最终需要在真实物理世界运行,而真实环境变量无穷无尽,难以彻底标准化。仿真环境中成功率近乎满分的模型,部署到实体机器人上可能无法完成基础抓取;实验室稳定运行的算法,遭遇光线变化、物体偏移就极易失效。仿真评测与现实场景的天然鸿沟,进一步削弱榜单参考价值,加剧评价体系混乱。
榜单乱象,是行业从泡沫走向成熟的必经阶段。概念火热、资金大量涌入、商业化尚未兑现之时,市场迫切需要简单符号区分企业优劣。随着产业不断推进,资本的评判标准终将发生切换。
2026 上半年赛道依旧维持融资热潮,百亿估值独角兽数量大幅增长,各家企业不断刷新模型参数记录、冲刺榜单榜首。但行业风向已经出现微妙转变。WAIC 2026 成为重要风向标,展会告别单纯的表演式演示,众多企业搭建微型真实工位,部署洗衣、零售、分拣等商业化场景,推行 “零遥操、纯自主运行” 展示标准。行业评价维度,逐步从单次动作成功率,转向连续作业时长、故障自主恢复、场景部署成本等贴近产业需求的指标。《全球工业具身智能导则》编制工作正式启动,行业开始尝试搭建工业场景统一技术规范。
头部企业陆续开启资本化进程,宇树科技冲刺 A 股、智元机器人启动港股上市。IPO 硬性要求正在倒逼行业挤出泡沫,二级市场投资者更加看重机器人出货量、稳定营收、可持续商业模式,单纯依靠榜单排名的叙事难以持续支撑高估值。当头部企业依靠真实交付业绩登陆资本市场,整个赛道估值体系将会迎来重构,依靠榜单抬高估值的窗口期正在关闭。
科技赛道的发展规律反复印证,概念炒作、榜单泛滥、估值泡沫是前沿技术产业化前期普遍现象。具身智能承载通用人工智能落地物理世界的巨大想象,阶段性乱象无可避免。但所有泡沫终将褪去,纸面排名无法长久支撑企业发展。
具身智能真正的终极考场永远是真实物理世界。机器人步态稳定性、模型跑分成绩,最终都要回答同一个核心问题:能否在工厂、商超、家庭场景稳定创造价值。当下,赛道正处在告别概念炒作、迈向产业化的成人礼。短期榜单竞争喧嚣终会散去,长期技术长跑刚刚开启。能够穿越周期留在行业内的企业,不会是榜单上短暂登顶的玩家,而是能够扎根实景、持续落地、创造真实产业价值的参与者。