首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
行业动态
机器人背后的人:数据采集员
2026-09-02 20:04:05   转载自21世纪经济报道

在觅蜂科技的数采工厂里,一名数据采集员头戴传感器头盔,佩戴腕部相机,把桌子上的积木拼成指示图所示的样子。

任务不难,但他必须以正常速度的一半完成,不能有任何多余动作。拼好后按下结束键,一次任务完成,再把积木推倒,如此重复多次。

数据是 AI 时代的石油,训练的 “原油” 就是这样被开采的。

无本体采集是近两年增长最快的数采方案。21 世纪经济报道记者在现场了解到,一名采集员每天要工作大约 10 至 12 小时,最终完成 4 至 5 小时的数据采集。采集过程中必须遵循严格的标准操作程序 —— 动作不能太快,光线不能太暗,镜头不能被遮挡。

“这一套动作一天要重复一百多次吧。” 一名数据采集员向记者表示。

目前工厂内的数据采集,更多是让采集员在受控环境中执行标准动作 —— 背景单一、光线可控、动作规范。这种模式能保证数据的 “干净” 和完整。

而外部采集则是把设备发放给 C 端用户,让他们在做家务、干本职工作的同时 “顺便” 采集数据。这种分布式采集模式的好处显而易见:数据带着现实世界的 “噪音”,恰恰是机器人形成泛化能力亟需的 “养分”。

8 月 31 日,觅蜂宣布累计产出超过 100 万小时高质量无本体数据,全部来自开放环境中的真实采集,其数采设备已陆续进入家庭、办公、零售、生产、餐饮等真实场景。

觅蜂科技的一位负责人向记者打了个比方:人类不是只在驾校里学会开车的,而是在长期置身于各种真实场景中才具备了应对不同路况的能力。机器人也一样,真正的泛化能力要靠外部采集来支撑。

目前,数据仍然是具身智能发展的核心瓶颈。统计显示,国内真实物理交互场景合规数据仅 50 万小时,而机器人商业化落地需要数千万小时数据,缺口超过 99%。

上述负责人向记者表示,具身智能比大语言模型更难,不仅需要推理和语言能力,还涉及动作和现实世界的物理交互。这需要的不仅仅是更多数据,更是更多样、更真实的数据。

(来源:21 世纪经济报道)


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有