7 月 10 日,蚂蚁灵波正式推出行业首个具身原生世界动作模型 LingBot-VA 2.0,实现机器人基础模型研发逻辑的重大转型,行业发展路线从依托数字世界模型改造适配,转向面向真实物理世界原生定制开发。
当前行业主流具身世界模型普遍采用成熟视频生成模型微调改造的模式,但视频生成模型侧重画面画质、创意生成,和机器人控制追求实时推理、因果预测、动作精准执行的核心诉求存在底层冲突,直接微调会引发模型知识遗忘、跨场景泛化能力衰减等诸多痛点。LingBot-VA 2.0 放弃改造嫁接思路,采用自回归架构从零完成预训练,依托四大核心创新设计搭建专属具身原生基础模型。
模型搭载语义视觉 - 动作分词器,在视觉信息压缩阶段同步完成语义、动作信息对齐,打通自然语言指令与机器人实操动作的转化链路,有效提升指令跟随能力与动作执行精度;全程采用因果预训练范式,依托自回归架构保障视觉预判、动作生成严格遵循时序逻辑,贴合真实物理世界变化规律;引入 MoE 混合专家架构,在不降低推理速度的前提下扩充模型容量,兼顾综合性能与运行效率;搭配增强型异步推理机制,机器人执行作业的同时同步预判环境未来状态,结合实时观测数据持续修正决策,解决行业普遍存在的世界模型运行卡顿、闭环延迟高的痛点,达成单卡 150Hz 超高实时推理效率。
真机实测场景下,LingBot-VA 2.0 无需外部辅助拍摄设备,即可自主完成与人类的随机多轮对抗交互,充分验证模型优秀的环境泛化与实时响应能力。
本次 LingBot-VA 2.0 也是蚂蚁灵波本周系列模型发布的收官产品,此前企业已连续推出多款配套基础模型,覆盖空间感知、多机协同、实时交互、视频生成全链条,包含空间感知模型 LingBot-Vision、LingBot-Depth 2.0,支持一脑多机调度的 LingBot-VLA 2.0,实时交互世界模型 LingBot-World 2.0 以及高推理效率视频基础模型 LingBot-Video,形成完整具身原生全栈模型矩阵。
蚂蚁灵波 CEO 朱兴表示,企业将持续深挖具身智能技术性能边界,同步搭建开放技术生态与落地场景生态,推动机器人技术加速走向工业化应用。
企业计划于 7 月 17 日至 20 日亮相 2026 世界人工智能大会,在上海世博展览馆 H3-B302、H1-C701 两大展位集中展示全套全栈大脑 2.0 系列模型实景落地效果,开放现场实操体验。