
如果把 GPT-3 的 in-context learning 看作自然语言处理的转折点,那么 Generalist AI 在 2026 年 8 月 19 日发布的 GEN-1.5,很可能就是机器人操作领域的对应时刻——一段 3 到 12 秒的演示,塞进上下文窗口,不做任何梯度更新,机器人就尝试执行这个新任务。
但作为开发者,我们关心的不只是"59% 成功率"这个被反复引用的数字,而是它背后整套范式迁移:机器人编程的冷启动,可能从"采集数百条遥操数据 + 训练数天",压缩到"录一段短视频 + 等模型自己跑"。
GEN-1.5 是一个大型多模态模型,接收视频(30 秒记忆窗口)、其他传感器、语言、本体感受信号,输出 100 Hz 的动作轨迹。
"物理提示"(Physical Prompting)的机制非常直白:
整个过程权重一动不动。这和语言模型里"给两个 few-shot 例子就让模型答第三题"是同一个计算隐喻——只不过这里的 token 是像素和力矩。
Generalist 强调一个容易被忽略的细节:他们从 2024 年便开始预训练 GEN-1.5,训练持续 8 个多月,但没有为上下文学习改架构、没有内外层元学习循环、也没有鼓励即兴的辅助目标。换句话说,in-context learning 这种能力是预训练规模上来后自然涌现的,连团队自己都说不清为什么。
对开发者的含义:这意味着"上下文学习"可能不是某个精巧算法的产物,而是数据规模和训练时长到位后的必然。如果你在做具身智能,方向可能比技巧更重要。
官方给出的评测是 10 项短时域操作任务(开罐、拉笔袋拉链、从钱包取钞、用刷子扫垃圾等):

几个开发者需要留意的细节:
第一,59% 不是"评估一次就完事",而是零梯度条件下模型第一次见到任务就能拿出可测量的能力。Generalist 自己也承认 in-context 学到的技能比微调模型更脆弱(brittle),但已经能泛化到扰动、即兴发挥、从错误中恢复。
第二,10 步梯度更新改变的权重不到 0.15%——说明微调不是"重建表征",而是在轻微重组已有知识。这就是为什么 1–10 步就够,而不是传统 imitation learning 的上千步。
第三,任务间差异极大。例如"用刷子扫垃圾"单次提示只有 37.3%,10 步更新后跳到 99%;而"把手机翻面"单次提示就有 78%,更新后 81%。有些技能靠上下文就接近微调效果,有些强烈依赖参数适配——这直接决定了生产部署时你要不要走微调这一步。
除了单次学习,GEN-1.5 还有三件事值得写进技术笔记:
组合泛化:把两个独立录制、彼此之间没有过渡的演示放进同一个上下文,模型会自己补出重新抓取、纠错、换手这些两段演示里都不存在的中间动作,串成一个连续行为。这相当于物理世界的"prompt chaining"——你不用为复合任务采集复合演示,只需维护一个短物理提示库。
零样本 sim-to-real:对部分任务,演示完全可以来自仿真(脚本策略、RL agent、或在仿真里遥操),尽管预训练数据里一帧仿真数据都没有,真机仍能执行。这是直接击穿 sim-to-real gap 的诱人路径。
人→机器人跨形态:人在摄像机前用自己的手演示,机器人用自己的手复现。这为"非专业用户教机器人"打开了接口。
作为开发者读这类发布,必须越过宣传语看限制。AI Wiki 的元数据汇总说得很直白:
GEN-1.5 通过公司研究博客和演示视频发布,不是可下载的 checkpoint、不是公开 API、也不是同行评审论文。架构、数据、评测包均未公开,截至发布日没有独立第三方复现。
具体边界:
第一,任务简单、时域短。10 项评测都是短时域操作,59% 离无人值守工厂的可靠性差得很远。长程、多阶段、需要持久记忆的任务尚未验证。
第二,"单次"指上下文里有一个演示,不代表技能永久写入模型。演示离开上下文窗口后,能力是否持久未知。
第三,公司自报,非公开基准。所有数字来自 Generalist 内部评测包,没有 model card、没有权重、没有开源评测。
社区里已经有人把 GEN-1.5 称为"机器人的 GPT-3 时刻",但这个类比要谨慎:GPT-3 之后有开源复现、有 API、有下游生态;GEN-1.5 目前只有视频和博客。真正的"时刻"要等权重或 API 放出、第三方跑通评测之后才算。
如果你正在做具身智能相关开发,GEN-1.5 这波发布真正有价值的信号不是"59%"这个数字,而是范式层面的三个转移:
至于现在能不能用?不能。没有权重、没有 API、没有评测包。但作为技术方向标,它给所有做 VLA、world model、imitation learning 的团队抛出了一个尖锐问题:
当"上下文学习"能在物理世界涌现,我们还在为每个新任务从零收集数据、跑监督训练,是不是走错了路?
9 月到 10 月是观察窗口:看 Generalist 是否放出 API 或 early-access,看是否有第三方团队用自家数据复现 59% 这个量级。在那之前,把它当作"预训练规模定律延伸到具身域"的有力证据,而不是"开箱即用的机器人 GPT",后者还需要生态和时间来验证。
参考文章:Generalist AI 官方博客、AI Wiki