2026 年被视作具身智能元年,行业报告测算国内市场规模将达 1.09 万亿元,数据服务板块占比超 15%。但产业底层存在严重供给缺口,截至 2026 年初,全球可用高质量物理交互数据仅 50 万小时,而训练通用具身模型至少需要千万小时级数据,缺口超 99%,行业深陷数据饥荒。
语言大模型依托互联网海量文本、视频素材完成训练,素材属于第三方静态观察类信息,采集成本极低,海量公开内容可直接取用。但机器人无法复用这类数据,具身智能需要的是交互视角下完整时序物理传感信息,一段标准抓取数据,必须同步留存视觉、深度、力反馈、触觉、电机扭矩、关节角度等连续信号。网上操作视频仅记录画面,不会留存力度、力矩等物理参数,这类信息无法被动生成,所有优质真机数据都要人工从零生产,行业核心矛盾并非数据总量不足,而是适配训练的有效交互数据极度稀缺。
星海图 CEO 高继扬提出,完整的具身数据需要覆盖动作、对象、场景、本体四大维度,动作区分抓取、折叠、敲击等操作类型,对象涵盖不同材质、重量、形态的物体,场景包含家庭、工厂、商超等差异化环境,本体对应不同构型、尺寸的机器人设备。四大维度交叉形成庞大数据空间,当前行业采集样本仅覆盖极小范围,直接造成机器人换物体、换场地、换设备后性能大幅下滑。
行业现已形成四层金字塔式数据采集路径,四类路线各有优劣,单一模式无法满足训练需求,企业普遍采用混合搭配方案。底层是互联网第一视角操作视频,几乎零成本、场景覆盖面广,但缺少精准物理标注与力觉信息,仅可用于模型前期预训练搭建基础世界认知。往上一层为仿真合成数据,依托虚拟引擎批量产出交互轨迹,可全天候并发采集、成本低廉,但存在显著虚实迁移鸿沟,斯坦福相关报告显示仿真内任务完成率近九成,落地真实家庭场景后仅剩 12.4%,性能流失严重,多用于扩充长尾动作与极端故障样本。再上层是无本体采集,工作人员穿戴动捕、头戴摄像设备完成示范,无需机器人参与,单小时采集成本仅五十至百元,国内已出现面向普通民众的数据采集点位,普通人日常做家务即可产出数据,适合快速拓宽场景覆盖,但缺少真机原生力反馈,需要少量真机数据完成微调校准。金字塔顶端是真机遥操作数据,远程操控实体机器人作业,同步采集全套多模态传感信号,数据贴合真实部署工况、迁移损耗最低,但成本高昂,整套遥操设备投入超二十万元,规模化采集成本极高,业内测算 Optimus 人形机器人工厂落地所需数据采集成本或超五亿美元,主要用于模型最终微调,保障真机实操精度。
相较于数据总量缺口,质量、多样性、流通性三大隐性问题对产业制约更为突出。当前多数数据集仅收录成功操作样本,缺失抓取失败、碰撞、故障恢复等边界场景数据,导致机器人只会标准示范,无法自主纠错自救,均普智能开源全流程成败数据集,正是为补齐这一短板。各企业依托自有机器人采集数据,本体、传感器标准不统一,数据跨机型复用难度大,且采集环境多为受控实验室,面对杂乱、多变的真实环境极易失效,样本多样性不足阻碍通用智能涌现。同时行业缺少统一的数据格式、标注与元数据规范,数据与硬件设备深度绑定,企业重复采集同类基础数据,数据孤岛问题严重,稀缺资源难以流通复用。
政策与企业正同步发力破解数据供给难题,2026 年 6 月国家数据局出台专项方案,将具身智能数据集建设列为重点创新方向,北京、上海等地同步推出数据补贴、产业扶持政策。企业端加速布局规模化采集产能,千寻智能在百余个城市布设三十万采集点位,专职采集团队超千人,星海图定下百万小时年度产出目标,三年冲刺千万小时数据规模。数据基础设施也持续完善,均普智能推出全链路工业具身数据平台,覆盖采集、质检、自动化标注、格式转换、模型训练全流程,依托 VLM 大模型完成八成人工标注替代,统一多硬件、多算法框架的数据转换标准,逐步打通数据流通壁垒。
行业已形成统一共识,具身智能产业突破无法依靠单一企业独立完成,需要搭建标准化采集标注规范、规范化数据交易机制、行业共享数据集生态。如同语言大模型在积累足量文本后实现智能涌现,具身智能同样需要千万小时高质量交互数据抵达能力临界点,在此之前,再先进的算法与硬件都缺少核心训练燃料,数据基建是万亿具身赛道长期竞争的核心壁垒。