首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
用手机就可以采集具身智能数据,Vbot 的无本体跨视角数据管线
2026-09-10 20:23:30   转载自维他动力

用手机记录一段人类示范不难。难的是,怎样把这些画面变成机器人训练和使用时可用的数据信息。

为什么引入人类示范?

完成一个 Manipulation 任务,通常要采集机器人数据、训练模型,再上真机调试。这是获得高性能策略的可靠路径。但数据往往与本体和场景绑定,条件一变,就可能需要补采、重新调试。

Vbot 因此将人类示范作为任务信息的另一种来源。但示范记录的是人如何完成任务。人和机器人的身体不同,即使任务相同,也很难共用同一条动作轨迹。

在 Vbot 的这条路线里,人类示范只说明任务,机器人则通过自身的第一人称视觉和本体数据学习执行。

这就是 Vbot 对具身数据的第一性原理判断:从观察中学习任务,在实践中掌握技能。

手机视频,怎样变成空间任务资产?

为了在更多真实场景中采集人类示范,Vbot 选择普通手机作为入口,不需要目标机器人到场。采集端尽量简单,把原始影像转成模型可用数据的技术工作交给后端管线。这就是 "采集做轻,管线做重" 的取舍。

以 "将四个指定对象按给定顺序放入盒内" 为例。Vbot 用多路手机记录同一次人类示范。不同视角分别看清手与物体的局部过程,以及整体场景中的任务进展。

数据管线将多路画面按时间对齐,并在同一空间坐标系下完成重建。这样,同一时刻的手与物体位置可以在不同视角间相互核对,整个过程也能按时间追溯。对齐后的画面与重建结果共同组成一份空间任务资产。

把多视角输入放进统一空间,也是近期 World Labs Atlas 采用的数据组织方式。

从多视角记录空间任务资产

一段完整示范,模型要看什么?

空间任务资产保留完整示范过程,再从中提取关键交互,供动作模型参考。

为此,每个关键阶段保留目标物体和双手的局部画面,并记录手腕、拇指尖、食指尖的位置,以及计算得到的捏合中心。这些信息构成一个 Visual Subpose(关键交互视觉参考)。

多个 Visual Subpose 按任务顺序组成参考序列。

可以把它理解成一组任务卡:每张卡说明轮到哪个物体、关键交互是什么样,但不规定机器人的抓法和运动路径。

从人类示范到 Visual Subpose 参考序列

参考序列怎样进入模型?

训练时,模型学习结合参考序列和机器人观测生成动作,机器人数据中记录的动作作为学习目标。

推理时,新的示范也会被整理成同样的参考序列。模型无需为当前任务更新参数。动作生成模块结合这份序列、当前观测和执行历史生成动作,再根据新观测继续判断。

从 Human Prompt 到 Robot Action 的在线执行链路

近期发布的 Skild S1 和 Generalist GEN-1.5 也将示范作为运行时任务条件。

真机上,机器人会不会照搬人的动作?

在真机上,固定基座双臂机器人采用了不同于人类示范的抓法、路径和节奏,并将四个指定对象按给定顺序放入盒内。

同一个任务,两套动作

数据还能走向哪里?

如果引入公开视频,还要处理拍摄条件不一、素材质量参差的问题。任务扩展到移动操作(Loco-Manipulation)后,机器人需要在同一任务中协调自移动与物体操作,记录的过程也会更长。数据管线和相关世界模型如何处理这些问题,留待后续技术分享。

(来源:维他动力)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有