
炎炎夏日在北京亦庄 "2026 世界机器人大会" 的咖啡亭里,一台名叫 XMAN-R1 的人形机器人正踮着 "脚尖" 取杯、萃取、出品,履历表上的职务是 "特聘咖啡师";不远处的洗衣房两台机器人在统一调度下配合着洗衣、叠衣,动作衔接得不像是在演示倒像是在上班。这是 2026 世界机器人大会上擎朗智能搭建的 "具身社区" 一角。几步之外中坚科技旗下的消防机器狗正展示水炮作业:直流水柱压制明火,120° 广角喷雾负责降温隔烟,60 米的最大射程之外还配了一套水带自动脱落系统专为紧急撤离设计。两个场景放在一起看透着这个行业正在发生的换挡。过去几年机器人展会的主角是 "身体"—— 关节自由度更高续航更久奔跑姿态更像人,但今年快思慢想研究院院长田丰在现场感受到明显的变化:厂商们谈论最多的是数据。研究机构 Interact Analysis 的报告显示全国已经有至少 90 个人形机器人数据采集和训练中心处于使用或规划建设中 —— 这说明整个行业投资逻辑正在快速切换。
丹尼尔・卡尼曼在《思考,快与慢》里把人的认知拆成两套系统:系统 1 反应快速、直觉、近乎本能,系统 2 承担缓慢、审慎、依赖推理。这个框架不只是心理学规律如今也成了具身智能行业理解自己的方式 —— 机器人的 "大脑" 要做语义理解和任务分解,"小脑" 要管肌肉记忆式的力控和抓取稳定性,二者需要的数据完全不同。这套认知框架恰好也是 "快思慢想研究院" 名字的出处,而田丰对这场机器人 "数据竞赛" 做出判断:单纯囤积数据解决不了行业的规模化难题,真正决定节奏的是数据、本体统一性、商业闭环这三件事能不能同步收敛。
灵睿 P1 是中坚科技子公司桦之坚研发的工业级四足机器人,目前主要跑在电网巡检和园区安防的场景里,前面提到的消防机器狗就是基于这个平台二次开发的。这类 "脏活累活" 场景恰恰是机器人最先站稳脚跟的地方 —— 不追求万能只追求把一件事做到工业级可靠反复用。灵巧手赛道的进展更直观地体现在订单数字上,傲意科技 CEO 倪华良告诉《科创板日报》公司正在推进三笔大额订单分别是 1000 台、2000 台、3000 台合计近五六千台,日常的中小规模订单也在持续交付,客户数从第一年十余家到第二年破百家截至 2026 年上半年已接近 300 家。但倪华良同时给出了一个更清醒的注脚:客户结构符合经典的 "二八法则"(他称之为 "一九法则")——10% 的客户贡献 90% 以上收入,剩下 90% 的客户仍处早期验证阶段往往只采购一两台,采购十台已算 "大单"。这组数字提醒人们订单增长和商业化成熟中间还隔着一段距离。
仙工智能的展示更偏 "系统集成":搭载机械臂的 AI 配送机器人能完成抓取、导航、避障、3D 避障和电梯交互,把过去要多台设备甚至人工配合的环节整合成一个闭环;具身叉车则能持续识别不同颜色的托盘并完成叉取,现场的 BEV 实时感知画面随环境变化不断更新。仙工智能联合火星加速器发起的 "阶梯计划" 也在大会上落地,首期公布 20 家生态合作企业目标是到 2030 年实现 100 万台具身智能机器人落地。擎朗智能的底气来自其 KOM 3.0 大模型 —— 号称全球首个融合潜空间世界模型的服务行业 VLA 架构,撑起了洗衣房、咖啡亭、甜品屋、零售店四大场景的 "具身社区"。创始人兼 CEO 李通对《科创板日报》的判断很直接:"现在可以说已经到了商业化落地元年,机器人是不是真能干活是人形商业化的本质,岗位化策略是通向大规模商业化的必由之路。" 他给出了一个时间坐标:以进入家庭为标志至少还需要五年以上;但在工业和服务业里只要找到具体岗位、让机器人在有限范围内完成泛化任务,这个目标近期就有希望实现。
硬件供应链也在同步跟进。兆易创新展示了覆盖 MCU、模拟、存储的具身智能产品线,本月刚发布的 GD32H77R 和 GD32F50MxxG 率先亮相:中科硅纪 M6 灵巧手用的是 GD32F503 主控,11 关节 6 驱动、整手仅 410 克;松延动力的 Bumi 小布米以 GD32H75E 为核心,98 厘米、17 公斤、21 个运动自由度,是全球首款万元价位内的高性能人形机器人。如果说去年的展台是在比拼哪个机器人跑得更快,今年的展台比的是谁家数据采集装备更高效,具身智能的长期竞争力正取决于是否拥有高质量、低成本、可持续积累的真实交互数据 —— 这也是 2026 届世界机器人大会数据采集方案成为全场焦点的原因。
千觉 XTac 展出的 UMI G1 穿戴式触觉数据采集夹爪由主夹爪、从夹爪、背负式计算单元、头显套装和可视化终端组成,能在自然的人机交互中同步采集视觉、触觉、位姿、夹爪状态和 IMU 数据 —— 现场观众用两指夹爪抓取口红、口香糖、名片,屏幕上实时跳出视觉与触觉的输出结果,围观感堪比一场街头魔术。仙工智能干脆把数据采集独立成为公司:现场宣布成立杭州开物创新具身智能科技有限公司,打通真机数据采集、多源接入、数据治理、模型训练、仿真评测与能力回灌的完整链路,并计划年内第四季度开源数据集和自研评测基准。强脑科技的数采矩阵则整合了真机执行、真人示教与仿真生成三种数据来源:真机数据靠双臂轮式数采平台采集,搭载 21 自由度全掌触觉灵巧手 Revo 3;人类操作者戴上 RevoHuman 外骨骼数采手套,手部姿态、触觉与腕部视角就能同步转化成可训练的多模态数据。
帕西尼的 PXCap Pro 数据采集手套一个人戴上就能同时操控多台异构灵巧手,动作被实时重映射并同步执行,实现 "一次采集、多机复用"。大晓机器人的 ACE 系列构建了从采集、标注到跨本体应用的完整链路,其中 ACE Sense Glove 是行业首个集成三维力触与动捕信息的采集手套,力触觉灵敏度达到 0.01N,关节角误差小于 2°。公司董事长、商汤科技联合创始人王晓刚在采访中提出一个更长期的判断:随着真人环境式数据持续增加、世界模型能力不断增强,行业对真机数据的依赖会逐步降低 —— 当基础模型足够强大,完成特定动作对齐可能只需要数小时而不是过去动辄上百小时的真机采集。这也印证了未来学家罗伊・阿玛拉那句常被引用的话:"我们总是高估一项技术的短期效果,却低估它的长期影响"—— 具身智能的数据积累眼下看着缓慢,但复利效应一旦启动拐点可能来得比预期快。
光轮智能拿出了目前公开信息中规模最大的开源数据集:10 万小时的 EgoSuite-Open100k,覆盖 15000 余类场景、15000 余种任务,通过 Hugging Face 向学术与商业研究开放,并同步启动 "5 年 100 亿具身智能数据共建计划",与阿尔特、五八同城、吉利、新希望、宝通等签约。奥比中光则拿出一整套 "无本体" 硬件矩阵 —— 第一视角的 EGO、手持操作的 UMI、腕部近场的 WristCam、同步中枢的 Hub,覆盖真实交互的全部视角;傅利叶联合一行凌光展出的 EGO 数据采集头环 Lume R1 走的也是同一条路线。
田丰判断:机器人规模化落地的瓶颈表面看是高质量数据稀缺,但这只是表象,真正的结构性矛盾是数据、本体统一性、商业闭环三者能否同步收敛,单独囤积数据解决不了这个问题。数字最能说明这个 "表象",据 IDC 统计 2025 年人形机器人出货中商演、科研和数采场景合计占比 78.4%,真正进入工厂产线作业的比例很低。截至 2026 年 4 月底全国 90 个数据采集与训练中心里 64 个已投入使用,至少 13 个部署了百台以上机器人 —— 但对照行业公认的百万乃至千万小时级训练数据需求,可用的高质量交互数据仍存在数量级差距。田丰进一步解读:这个缺口的真正成因是数据采集正在为一个尚未被商业验证的市场 "预支" 资产,采集速度本身并不慢。经济学里最基础的一条常识是资产的价值取决于未来现金流的贴现而不是账面存量 —— 一旦下游场景的商业验证不及预期,眼下这批看似庞大的数据存量价值会大幅缩水。
大语言模型这些年信奉的经验规律是参数越多、数据越多能力越强即所谓 Scaling Law,国内不少数采场的建设逻辑正是把这条规律直接平移到了机器人身上 ——"先囤数据、后调模型"。但田丰指出这条规律在具身智能领域多了一道此前没人验证过的门槛。2025 年 11 月由 Andy Zeng、Pete Florence 团队创立的 Generalist AI 发布 GEN-0 模型做了一组机器人领域的对照实验:用 27 万小时真实操作轨迹训练不同参数规模的模型后发现,10 亿参数的模型难以吸收复杂多样的感觉运动数据,60 亿参数的模型开始明显受益于预训练规模,而真正的相变发生在 70 亿参数 —— 团队论文里用了一个很形象的词 "model ossification" 模型僵化。参数规模不够即便喂入再多数据模型也无法继续进步,只有跨过 70 亿这道门槛模型才能充分内化大规模机器人数据完成有效的多任务迁移,这是学界首次在机器人领域观察到这个现象。
比 "数据够不够" 更重要的问题是本体构型的碎片化。田丰观察到国内人形机器人本体尚未收敛到少数主流构型,各厂商在关节自由度、末端执行器、传感器配置上差异巨大,同一个动作在不同本体上采集的数据难以互相复用,名义上的数据总量被本体多样性稀释成大量 "孤岛数据"。这里有一个值得玩味的对照:语言模型的 Scaling Law 之所以成立前提是 "token" 作为数据单元在不同架构间高度通用;而机器人领域至今没有出现这样一个放之四海皆准的数据单元。数据结构没有标准化之前采得越多浪费也越多 —— 这不是勤奋能解决的问题是规则没定的问题。
田丰把当前的数据采集技术路线归纳为 6 种并行的范式:遥操作(穿戴设备采集人类操作)、动作捕捉(光学或惯性精确追踪)、仿真合成数据、无本体采集(以 UMI 为代表的轻量化手持设备)、互联网视频升维、真实产线场景采集。这六条路线更像是同一支球队里分工不同的球员各自守住一块阵地。无本体方案是眼下增长最快的一条路线,厂商披露的数据普遍在 "采集效率提升数倍、成本降至真机采集的五分之一左右" 这个区间,具体数字因厂商而异尚无第三方统一审计,但方向上的成本优势是业内共识。田丰给出了深入剖析:这个成本优势是靠牺牲本体动力学信息 —— 关节力矩、末端接触力、惯性反馈 —— 换来的,采到的是运动学层面的数据不是动力学层面的数据。精细操作比如装配、柔性物体处理仍然要靠真机闭环的力反馈数据来微调,两者是分层关系不是替代关系。
这个分层恰好对应了具身智能 "大脑 — 小脑" 的架构分工,也呼应了本文开篇提到的那套认知框架:越靠近底层的电机控制策略越需要本体特异性数据,好比小脑管的肌肉记忆容不得半点通用化;越靠近高层的语义理解和任务分解越能共享跨本体、无本体的通用数据,好比大脑管的审慎推理反而适配更广泛的输入。把无本体数据直接接入末端执行控制层会在 "UMI-to-real" 的迁移中放大误差,这是眼下不少团队踩过的坑。无本体路线还有一个容易被忽视的天花板:规模化瓶颈不在硬件成本而在人类动作库的代表性。如果采集样本主要来自采集人员自身的操作习惯而不是产线工人、家政从业者这些目标场景的真实操作者,模型学到的只是采集团队的动作分布不是目标场景的真实分布,这是数据代表性的系统性偏差,采集小时数堆得再多也无法消除,只能靠重新设计采集人群结构和场景覆盖策略来解决。
各地一窝蜂建 "数采场" 目的是什么?2026 年 8 月数字中国建设峰会披露的数字全国已建成启用超 70 家具身智能训练场,在建或规划中的另有 40 余家 —— 中心化的具身智能基础设施正在批量落地。这些场地眼下最大的价值是给跨厂商的数据格式、标注标准、评测协议提供了一个实践试验场,物理产能只是这个过程的副产品:工信部主导的人形机器人与具身智能标准化技术委员会(TC8)旗下的数据标准工作组 WG7 目前的时间表是 2026 年中建立标准体系、2027 年初出台正式标准,而配套的《YD/T 6770—2026 具身智能基准测试方法》已于 2026 年 6 月 1 日实施。测试评价标准先落地,数据质量与流通标准还在路上。
数采场也在悄悄改写产业链的现金流分布。据《数据猿》报道优必选 2025 年第四季度三个月内签下至少 6 笔数据采集中心相关订单合计约 8.29 亿元,占其 2025 全年签约额的 59% 以上。数据采集场是具身智能产业链上第一个出现稳定现金流的环节,其分量不亚于本体制造本身 —— 数采场把商业化冷启动的成本从单个厂商身上转移给了地方政府和产业基金。但田丰也点出了风险:不少地方采用国企出资建场、批量采购机器人、再从机器人公司回购数据的模式本质是一种 "账面闭环"—— 政府投资转化成了采购额和数据交易额的统计数字却较少验证真实产线的终端商业需求。这套模式短期内做大了数据吞吐量却让训练场的任务设计趋向同质化,集中在抓取、分拣这类标准动作上;一旦地方财政或产业基金力度退坡数据供给会同步收缩。这是当前数采场建设最大的结构性风险 —— 用采集的速度掩盖了商业验证的滞后。
安迪・格鲁夫有句话流传很广:"只有偏执狂才能生存",说的是对危机保持警觉的能力。放在具身智能赛道上真正的偏执是时刻追问一句:这些数据真的会被明天的商业场景兑现吗 —— 拼命囤数据、拼命扩产能从来只是手段不是答案 —— 我们不能把指向月亮的手指当成 "月亮"。回到那杯由 XMAN-R1 萃取的咖啡 —— 它好不好喝最终不取决于机器人采过多少小时的数据,而取决于有没有人愿意天天来买 AI 咖啡,这才是具身智能真正的商业护城河。