7 月 16 日,银河通用正式发布 WAM-TTT(World-Action Model Test-Time Training),这是全球首款面向具身世界动作大模型的测试时后训练框架,也是银河星脑 AstraBrain 持续学习体系的关键技术成果,打通从模型预训练到线下实景低成本适配的完整技术链路。
银河通用创始人兼 CTO 王鹤用厨师换厨房类比该技术核心价值:机器人通过预训练掌握标准化操作技能,进入光照、器具、布局完全不同的全新环境后,无需重新采集昂贵机器人轨迹,仅观看少量人类操作视频就能快速适配场景,原有操作能力不会丢失,解决行业机器人 “换场地就失效” 的普遍难题。
同步配套发布的实验论文数据显示,在光照、桌面高度、操作物体同步变化的陌生家庭场景中,传统上下文学习基线 WAM-ICL 九项任务平均完成度仅 7.1%,跨环境能力留存约 15%;采用 WAM-TTT 框架、使用同等人类示范视频后,跨环境表现保留率提升至 76%,综合性能差距接近 5 倍。单独拆分扰动变量测试,单一光照扰动下任务完成率 66%、空间布局变化下 56%,远超传统方案 12%、20% 的表现。
此前行业适配新场景主要存在三条技术路线,均存在明显商业化短板:一是重新采集真机轨迹监督微调,采集设备、人力、时间成本极高;二是上下文学习,长视频输入会分散模型注意力,场景泛化上限低;三是现场强化学习,需要机器人在产线、门店反复试错,商用场景无法接受故障损耗。WAM-TTT 创新采用测试时轻量化训练思路,完整规避三类方案的成本与落地缺陷。
整套框架搭建在银河通用自研 WAM 世界动作模型底座之上,该模型统一融合环境预测、动作生成两大任务,能够读懂人类视频里物体位置、形态变化等世界状态信息,无需转换人体关节信号就能关联机器人操作逻辑。框架拥有三大底层技术突破:第一,部署适配仅依赖无标注人类第一视角视频,全程不用真机遥操采集、动作标签标注,依靠自监督视频预测更新轻量化快速权重;第二,完全跳过传统人体姿态估计、动作重定向链路,不依赖人体与机器人关节映射,不受遮挡、深度误差、本体机型差异干扰;第三,采用权重分离记忆机制,预训练 WAM 主干、运动控制模块全程冻结,仅更新独立快速权重存储新场景信息,实现 “零遗忘”,适配新环境不会覆盖原有习得技能。
整套流程分为元训练、现场部署两大阶段:离线元训练阶段依托成对人类、机器人示范数据,建立视觉任务逻辑与机器人动作的对齐关系;线下部署阶段仅录入少量现场人类操作视频,系统自动生成专属轻量化记忆参数,机器人依托新增记忆适配全新场景。
多机型、多任务对照实验验证了数据成本优化效果,在三类实操任务、总数据量上限 200 条的约束条件下,100 条机器人轨迹 + 100 条人类视频混合数据集,和全部 200 条机器人轨迹数据集任务完成度分别为 74.1%、73.7%,同等训练效果下低成本人类视频可替代半数真机数据,重构行业数据分层供给逻辑:高价真机数据负责本体动作对齐,低成本人类视频承载场景、任务流程知识。
从产业维度看,行业竞争重心正从大模型预训练规模,转向部署阶段低成本持续适配能力。谷歌、英伟达、Physical Intelligence 均在布局部署期持续学习技术,但 WAM-TTT 首次形成完整可工程落地的后训练闭环。依托 AstraBrain 体系,WAM 基座负责通用认知规划,WAM-TTT 负责线下场景快速适配,改变过往新增门店、工厂就要重新采集真机数据、整机微调的交付模式。
未来落地场景可实现标准化交付:门店工作人员录制几段补货、分拣操作视频,系统自动生成专属场景快速权重,统一基础模型无需重复训练,大幅削减工程师驻场调试工作量。目前该框架仍存在适配时长、视频需求量、多客户权重管理等工程化待优化问题,但已补齐通用具身模型规模化商用的关键短板,推动行业从实验室预训练比拼,走向真实场景低成本落地新阶段。