首页
资讯
品牌
机库
测评
选购
租赁
零部件
社区
活动
开发者
赛事
视频
人物
展会
排行
------
反馈
科技资讯
硅谷最热具身模型看一遍就学会
2026-08-28 16:56:18   具身之家综合

  具身智能的大结果要来了!自上周 Generalist 发布能够学习 3 到 12 秒动作的具身大脑 Gen 1.5 以来,刚刚北美具身初创 Skild AI 又发布了全新机器人基础模型 S1,直接把机器人上下文学习的任务长度拉到了 10 分钟往上。这次的 S1 主打上下文学习(in-context learning ICL):无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频就能 "照猫画虎" 直接完成一整套从未见过的复杂操作流程。在官方演示里机器人完成了煎饼、冲泡咖啡、给植物换盆以及设备组装等长程任务,并且在未见过的任务上把成功率干到了 66%,远超基于语言提示的 VLA(只有 9%)。另外哪怕是走传统后训练微调的路线想追平 S1 只看一次演示的效果大概也要喂进去 380 次左右的任务演示。有推特网友表示通用机器人可能两年后就会出现而不是七年,还有网友表示从 Rhoda 到上周 Generalist 再到现在 Skild S1 的 10 分钟任务机器人真正的 GPT 时刻似乎正在出现,因为一旦这种能力真的泛化以后开发机器人技能可能真的会变得像给 ChatGPT 写 Prompt 一样。

  想要理解 S1 这次到底怎么个上下文学习咱们得先看看传统机器人是怎么学习一个新技能的。在传统的 pipeline 里机器人学习其实和大模型差不多:先在海量数据上进行预训练学会一些基础能力,然后到了具体场景再针对某个任务收集数据通过后训练让机器人学会专有技能。只不过问题在于机器人和大模型虽然流程差不多但数据成本却完全不是一回事,大模型的预训练数据大量来自互联网,哪怕到了编程、Agent 这些专门场景很多后训练数据也可以在线上快速获得甚至自动生成,但机器人就比较惨了预训练数据得在现实世界里采后训练数据还是得在现实世界里采。所以在技术博客中 Skild AI 就直接开麦了:如果一个机器人基础模型每学一个新任务仍然需要几十、几百小时真机数据再重新后训练那我请问这个 "基础模型" 基础在哪儿?他们甚至引用已有研究指出如果针对一个新任务的数据已经足够多那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型,所以具身预训练的意义到底是啥?对此 Skild 给出的答案是上下文学习。

  为了有一个参考坐标 Skild 拉来了大模型的发展路线作为对照,早期的 BERT 已经很强了但每碰到一个新任务往往还是得重新准备数据再微调一遍,真正改变游戏规则的是后来 GPT-3 之后逐渐显现出来的上下文学习能力:不用改模型权重只要在 Prompt 里给几个例子模型就能临时 "学会" 一个新任务。基于此 Skild 认为机器人现在其实还困在类似的 BERT 时代他们真正想要的是让机器人也完成同样一次范式转换,也就是说预训练真正的价值不应该只是让后训练少采一点数据而是让机器人最终获得 "从上下文里直接学习" 的能力。

  那么 S1 这次到底从上下文里学到了什么?Skild 认为真正能检验机器人上下文学习能力的其实就两个维度:一个是能不能学会训练时根本没见过的新技能,另一个是能不能把已有技能重新组合起来完成一个很长、很复杂的新任务。比如机器人只需观看一段翻煎饼的视频就能学会如何制作煎饼 —— 即便这项技能此前从未出现在它的训练数据中。与此同时相较于上周 Gen-1.5 展示的秒级视频 S1 这次直接把上下文学习拉到了最长 10 分钟,在植物换盆等任务中每个任务都需要连续完成几十个操作步骤,在这些长程任务的演示中机器人不仅需要做到照猫画虎还需要知道:我现在做到哪一步了下一步该干嘛技能之间怎么组合中间搞砸了又该怎么继续。也就是说机器人需要真正理解视频演示里任务 - 动作的意图见招拆招、随机应变而不仅仅是行为克隆那么简单。此外在植物换盆任务中从开始录演示到机器人自己上手只花了 11 分钟直接在效率这一块给传统后训练秒了。最后在整个过程中 S1 没有用 fine-tuning 也没上 post-training 模型权重完全不変用同一套权重就完成了博客里展示的所有任务,基本对齐了大模型从 Bert 需要特定场景微调到 GPT-3 只看演示就能完成 OOD 任务的跨越,唯一的不同就是用的 prompt 不再是语言而是用了能够更好对齐下游任务的动作视频。

  在实验部分 Skild 先在(训练数据)见过的任务和未见过的任务上对比了 ICL 视频 Prompt 和传统的语言 Prompt VLA。测试结果表明当训练数据只有 1000 小时时语言 Prompt 效果更好而随着数据规模增加 ICL 开始反超,到了 10 万小时训练时见过的任务上:ICL 96% 语言 Prompt 89%,而在真正关键的 OOD 任务上:ICL 66% 语言 Prompt 只有 9% 直接拉开了 7 倍以上的差距。为了验证 S1 的泛化性 Skild 又在不同的实验条件下进行测试,结果表明语言 Prompt VLA 的性能下降幅度最高达到 ICL 的 3 倍,也就是说 ICL 学到的不是固定场景里的动作复读而是更能跟着当前环境重新规划怎么做。最后在 One shot learning 方面 S1 在新任务上完全不做 post-training 只看一条视频演示成功率就达到 66%,相较之下传统 VLA 则大概要经过约 380 次演示的后训练才能追到同样水平,当然继续堆到 2000 次演示后传统 post-training 最终能做到 86%。所以结论可能不是 "以后机器人不用训练了" 而是:以前一个新技能可能得教几百遍现在先看一遍就能直接做到六七十分,这也是 Skild 所谓的 ICL scaling law:数据越多模型不只是会更多技能而是越来越会 "从演示里学技能"。

  Skild 成立于 2023 年背后站着两个 CMU 机器人圈的老熟人:Deepak Pathak 和 Abhinav Gupta,两人都是卡内基梅隆大学机器人研究所的教授,Deepak 主要研究机器人学习、强化学习和计算机视觉,Abhinav 则是计算机视觉、自监督学习领域的大神。早在 2022 年两人就合作过 WHIRL 让机器人通过观看人类视频进行 one-shot imitation 可以说 S1 这条路线也不是突然从石头缝里蹦出来的。作为北美具身圈的明星企业 2024 年 Skild 刚走出隐身模式就拿下 3 亿美元 A 轮、估值 15 亿美元,到了今年 1 月又完成 14 亿美元 C 轮融资估值直接干到了 140 亿美元以上 SoftBank 领投英伟达、贝索斯等继续上桌,两年多时间估值接近翻了 10 倍。横向对比来看 Skild 在北美具身圈的定位也相当特殊,相比于 PI 更像是在搞 "机器人 GPT"Generalist 最近强调的是 one-shot learner 以及 Genesis AI、Sunday 最近的全栈势头 Skild 一直强调的是一句话:Any robot any task one brain,它更强调跨 embodiment 希望同一个 Skild Brain 能够跑在机械臂、四足、人形等不同身体上,说的通俗一点就是想成为机器人时代的安卓:一个智能层塞进各种不同的身体里。这也由此决定了 Skild 的数据策略:全都要,Skild 把机器人数据看成 hardware proximity、diversity 和 scalability 三个维度:真机遥操最接近硬件但贵,第一视角人类视频最容易规模化但和机器人身体差得远,仿真便宜能猛造却又有 sim-to-real gap,所以他们对于 Robot Teleop、UMI、Egocentric Video、Simulation 基本上采取的就是都用的策略。而 S1 的 ICL 其实也是这条路线自然延伸:2025 年 9 月 LocoFormer → 2026 年 2 月首次 In-Domain ICL → 5 月第一次翻煎饼 → 8 月 S1 发布直接把上下文学习推到最长 10 分钟的 OOD 长程任务。所以现在真正值得关注的问题可能已经不是机器人还能不能学会更多技能而是:机器人学习一个新技能的成本能不能真的从 "教几百遍" 变成 "你做一遍它看一遍",如果这个 scaling law 还能继续成立那所谓机器人的 GPT moment 可能真的不只是又一个营销梗了。

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有