首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
让机器人先到得了现场
2026-08-28 16:53:15   具身之家综合

  前几天我在自家小区的业主群里刷到一条招聘广告:居家靠谱副业 AI 数据采集兼职。这类广告已经不算新鲜了,今年 5 月第一财经报道过一批 "居家数据采集员":他们戴着采集手套或者头戴相机在自己家里择菜、叠衣服、开抽屉,把这些动作录成视频卖给需要训练机器人的公司。据一家数据服务商透露其百人左右的采集员队伍里宝妈占比接近六成,居家岗位月薪在 3000 到 4000 元之间,社交平台上流传的日薪多在百元上下、时薪 25 元左右。具身智能行业对数据的渴求可见一斑,但我盯着那条广告看了很久想到的是另一件事:这些兼职能采到的全都是手(末端执行器)的数据,忽视了 "机器人本体与环境交互的运动数据"。

  数据缺口有多大行业已有计算,截至 2026 年初全球高质量真实物理交互数据的总量大约只有 50 万小时,不足大语言模型训练语料的两万分之一,而按照产业界较为一致的口径训练出一个真正可用的通用具身模型至少需要千万小时量级。于是资本和巨头一起涌了进来:光轮智能在今年 3 月完成合计 10 亿元融资估值突破 10 亿美元成为全球第一个具身数据独角兽如今估值已超过 20 亿美元;无问智科建起了国内规模最大的实体数据采集训练场日产数据上千小时;智元把数据业务拆分成觅蜂科技成立十天就拿到数亿元种子轮与天使轮;京东则宣布要发动数十万人两年内积累千万小时的真实场景数据……"机器人本体还没赚到钱卖铲子的先成了独角兽。" 这句话可作为今年上半年具身赛道的总结。铲子的形状也基本定型了,今年 WAIC 和 WRC 的相关展区里很多公司都摆出了自己的数据生产工具路线大致分四类:真机遥操作(人握着主臂、远端从臂实时复刻力反馈毫秒级回传数据质量最高但成本也最高)、动捕穿戴(把传感器穿在人身上成本降下来了代价是人机构型不同需要重定向)、人类行为视频(规模最大成本最低但缺乏位姿、力矩、触觉的精确标注)、仿真合成(速度快、成本低到真实数据的百分之一代价是域差异)。这四条路线的采集对象高度一致:末端执行器(也就是手)。这不难理解,抓取、装配、分拣、开门是最容易被拆解成任务、最容易被标注、也容易被商业化验证的动作,数据工厂里搭出来的仓储、家庭、酒店、零售场景本质上都是给手准备的舞台,但这一切还有一个前提:机器人要完成任何一项真实工作得先走到工作现场去。

  如果只看国内很容易把这理解成一个阶段性的资源分配问题:钱先流向了最容易变现的方向早晚会补上,但把视线拉到海外会发现这里还有一道结构性鸿沟。2023 年谷歌 DeepMind 联合 21 家机构发布 Open X-Embodiment 数据集,把 60 个既有数据集合并成统一格式包含超过 100 万条真实机器人轨迹、22 种本体、527 项技能,这是过去三年具身领域被引用最多的基础设施之一几乎所有主流 VLA 模型(从 RT-2 到 π0 再到 GR00T)都在它或它的衍生集上做过预训练,然而这项工作仅聚焦于机器人操作(robotic manipulation),22 种本体里虽然包含四足平台但技能清单还是抓取、推、开、关、擦拭、装配等动作。与之对照的是今年 2 月苏黎世联邦理工学院机器人系统实验室(ETH Zurich RSL)联合牛津大学发布的 GrandTour 数据集,他们用一台 ANYbotics 的 ANYmal-D 四足机器人背着 7.1 公斤重、功耗 120 瓦的多模态传感器套件跑遍了阿尔卑斯山地、森林、拆迁建筑和城市街区,采集了十台相机、三台激光雷达、多个不同等级的 IMU 以及 12 个关节编码器的同步数据,还配上了 RTK-GNSS 与徕卡全站仪提供的毫米级真值轨迹。论文称它是迄今为止规模最大的公开腿式机器人数据集,而其规模是:49 段任务每段 3 到 7 分钟总时长略超过 5 小时累计行走距离超过 10 公里。GrandTour 论文中如是写道:适用于腿式机器人的公开数据集依然稀少,研究者往往只能自行采集小规模、不具代表性的实验数据,或者退回到仿真里去开发状态估计、建图与感知 - 动作方法,而这些方法未必能泛化到真实场景的复杂度。

  正如前文暗示的那样具身数据有两重维度:感知与操作(相机、激光雷达、触觉传感器记录下环境长什么样、手对物体做了什么,这一重已经被数据工厂、遥操作系统和居家采集员的手套密集覆盖);本体与环境的交互(机器人在什么地面上以什么姿态移动关节输出了多大力矩机身承受了多大冲击和振动轮子在什么坡度上开始打滑越障时重心如何转移)。具体我们可以看 GrandTour 的传感器清单:关节位置、速度、接触力甚至运动策略的隐藏状态都被逐帧记录下来,这些量不是运动控制的中间产物它们本身就编码了大量信息可作为训练素材,一个模型如果没见过这些它或许可以知道怎么拿起杯子但不会知道踩上一块松动的钢板时该怎么办。于是下一个问题来了:该怎么获取机器人本体与环境交互的运动数据呢?一个重要判断是机器人只能自己去跑,举个例子居家采集员可以戴上手套演示如何拧开瓶盖但却没办法演示一台 30 公斤的机器人以 2 米每秒的速度冲上一段磨损严重的金属坡道时各个关节各自的受力情况,人类的腿和机器人的腿在构型、质量分布、驱动方式上差异很大,动捕重定向在操作数据上还算勉强可用到了整机动力学层面基本失效。这类数据也不能靠标注补齐,标注的前提是原始记录已经存在而力矩曲线和接触事件只在机器真的踩上去的那一刻才产生。基于此行业当前遇到的困难就呈现出完全不同的性质:不是人力不够是载体不够。

  既然这些数据很重要、有价值为什么迟迟补不上?答案正如本末科技总结的那样是三重叠加的结构性约束。第一重是仿真固有限制,仿真可以近乎完美地复刻几何外观也能把渲染做得足够真实但物理属性的复现始终是一道坎,机器人学界把它称为 Reality Gap,2017 年 OpenAI 提出的域随机化、后续 ETH 团队发展出的执行器网络辨识、以及去年开始流行的关节空间动力学拟合都是为了绕开这道坎而生的方法,方法之多本身就说明了问题的顽固程度,地面摩擦系数、材料形变、接触冲击、轮胎打滑这些量在仿真里通常以参数形式给定而在真实世界里它们会随温度、湿度、磨损与污染持续变化。今年 5 月一篇针对四足轮腿机器人的研究干脆把复杂地形高程与物理摩擦当作 "无法观测的外部状态(unobserved hidden states)" 来处理靠历史本体感受信号隐式估计,而 GrandTour 发布后被最快用上的方向之一正是改进 sim-to-real 迁移与真实环境的 real-to-sim 重建,也就是说连算法本身都默认了这些量必须从真机数据里学而不是从仿真里读。第二重是载体约束,台阶、斜坡、泥泞地、有跨线和油污的工业地面、灾后废墟…… 这些最需要数据的工况也正是大多数轮式底盘进不去的地方,载体进不去对应工况下的交互数据就永远不会产生,这是一条硬约束加人力、加预算都绕不过去因为这些地方缺少的是抵达能力而非记录能力。第三重则是机型约束,大量设备是为单一场景做的专用定制机型换一个环境就要重新改造硬件,对于需要跨场景采集的团队来说这意味着每开一个新场景都要重新走一遍选型、改装、调试、验证的流程时间与资金成本极高采集半径被牢牢锁死。把三重约束叠加起来可以得到一个不太舒服的结论:载体的物理上限就是训练数据的上限,一台只能在平整地面工作的机器人无论运行多久都不会产出台阶与泥泞地上的运动数据,一个模型也就不会知道在那些地面上该怎么走。

  如何解决这些问题呢?本末科技(Direct Drive Tech)提供了一整套方案而他们出发的方向也很不一样,这家公司创立于 2020 年创始人兼 CEO 张笛毕业于香港科技大学师从 "大疆教父" 李泽湘。本末科技最初的技术选择相当激进:舍弃机器人关节里的减速器用直驱方案让电机直接输出扭矩以此换取更低的噪音、更长的寿命和更低的故障率,这条路走通之后本末科技在消费机器人动力模组市场拿到了相当稳固的位置,据了解该公司是全球首家且唯一出货量超过 500 万套的公司,2026 年 6 月 29 日本末通过港交所主板上市聆讯正冲刺港股。是的今天的本末科技是一家靠卖电机赚钱的公司机器人整机还是一门刚起步的小生意,但机器人也是让其与数据问题产生关系的关键业务线,从 2021 年开始本末陆续推出了刑天、TITA、D1 三代轮足机器人。轮足这条路线的特点是把轮式的速度与足式的地形适应能力揉在一起:平地上用轮子跑遇到台阶和沟壑就用腿。本末科技的招股书中认为这种形态符合其开发通用机器人的技术目标因为 "我们认为轮足形态是具身智能机器人必不可少的下肢配置" 并且 "我们认为能选择自己形态的机器人将具备比人形机器人更强的通用性"。这是一个和当下主流叙事相当不同的技术判断,过去两年具身智能的注意力几乎全部集中在上半身包括灵巧手、双臂协同、抓取策略,本末押的是下半身理由是通用性最终受限于抵达能力而非操作能力,这个判断是否成立还需要时间验证但它和本文前面所有的推演指向同一个方向。综合而言从做电机到做整机本末走的是一条 "部件 - 整机" 双向验证的路,零部件降低整机的研发门槛,整机在真实场景里跑出的负载、续航、动态响应数据反过来驱动零部件迭代,这个闭环原本是为产品服务的但它顺带产生了一个副产品:一批能在非结构化地面上持续运行、并且把自己的运行状态完整记录下来的载体,这正是前面三重约束所缺的东西,三条产品线正好对应三种此前很难采的数据。

  刑天面向的是科研开发,其全身由 6 个直驱关节驱动,重要指标包括站立载重 4 公斤、最高跳跃 8 厘米、最高行进速度 2 米每秒、横滚角控制范围 ±37 度、16 位编码器带来 0.01 度的稳态误差。这些数字本身不算惊人真正对科研有意义的是它开放的部分,直驱关节没有减速器意味着力矩传递路径更短关节层级的电流、力矩、位置数据更接近真实物理量中间少了一层需要辨识和补偿的传动环节,配合开放的控制接口实验室可以直接拿到关节级的原始信号。据了解刑天推出后已经进入多所高校与机构的研究场景比如中山大学视觉导航技术在刑天机器人上的实测展示。对照 GrandTour 那样的工作我们可以这样理解这类平台的意义:一个实验室要做出可用的腿式数据集前提是有一台愿意把关节编码器、接触力、状态估计中间结果乃至控制策略隐藏状态全部开放出来的机器,本体的原始信号决定了研究的深度。

  TITA 面向的是巡检,8 个准直驱关节模组、峰值扭矩 120N.m、8 个自由度、动态最大负载 10 公斤、最高跳跃 20 厘米、速度 3 到 5 米每秒;机身搭载 NVIDIA Jetson Orin NX 16GB 配合超声波、SPAD ToF 与双目相机做自主避障;结构上用了比铝合金硬 3.35 倍的镁合金工艺可在 - 10~45°C 的环境中持续工作支持电池热插拔和 POGO Pin 快拆快装,这些参数表明 TITA 是为长时间、在园区与矿山这类工业环境里反复跑动而设计的。而巡检本身就是一种天然的数据采集行为,ANYbotics 那 200 多台机器人每周执行的数千次巡检产出的不只是设备温度和气体浓度读数还有同一段路面在不同天气、不同磨损状态下被反复通过的运动记录,这是实验室场地很难复现的时间维度也是巡检机器人相对数据工厂的独特优势:它的数据是干活的副产品边际成本接近于零。不仅如此两台 TITA 机器人还可以拼接成 TITATIT 机器人实现更强大的能力,这也是全球首款商业化推出的可拼接轮足机器人。

  D1 面向的是高复杂地形,这是本末在 2025 年末推出的模块化整机核心是全栈自研的 P10 系列一体化关节模组,把电机、传感器、驱动器与控制器集成为 "感驱控一体化" 单元配合被称为 "通用小脑" 的协同算法可以在 3 秒内完成多模块拼接,在双轮足、四轮足、足式甚至人马式等构型之间切换。据本末公布的数据四轮匍匐模式下最大负载可达 100 公斤站立模式下仍能保持 80 公斤双轮足模式空载实测可连续运行超过 5 小时。模块化在数据语境下还有一层意义,三重约束中的第三重是机型约束换一个场景就要换一套硬件,如果构型可以在几秒内重组那么同一套关节模组就能在双轮足形态下钻进狭窄管廊在四轮足形态下驮着更重的传感器爬过碎石坡,载体的适应半径变大数据采集的边界也跟着变大。更微妙的是不同构型跑同一段地形所产生的数据本身就能构成有价值的对照组:同样的地面 + 同样的传感器 + 不同的运动学结构这正是现有腿式数据集最缺的那种变量控制。

  需要说清楚的是本末科技并不是一家数据公司,它不建数据工厂不卖数据集也没有把数据资产单独定价,它做的仍然是电机和机器人。但正因如此它在数据这件事上的位置值得单独看一眼,当整个行业把注意力放在 "谁能采到更多小时数" 的时候一个更前置的问题常被忽略:那些小时数是从哪里长出来的?数据工厂可以规模化生产厨房里的抓取轨迹却生产不出湿滑钢梯上的力矩曲线;招募一万名居家采集员可以把家务动作的覆盖度做到很高却无法让任何一条数据出现在矿井里。这不是说手的数据不重要恰恰相反它是当下最紧缺、也最先被商业化的部分,只是 "通用具身模型" 的 "通用" 两个字终归要包含移动能力能不能到达工作环境也正在成为重要瓶颈。回到我们小区群里那条广告它招募的是人的时间交换的是人的手在家庭场景里的示范,这门生意会继续扩大也确实会解决一部分真问题,但具身智能另一个真实存在的数据边界不由招到多少人决定而由多少台机器人能跑到多远的地方决定。在数据采集元年最稀缺的或许是能真正去到现场的机器人。

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有