
继今年 7 月开源 LingBot-World 2.0 14B 模型后,今天,我们进一步开放三款模型:LingBot-World 2.0 Small(1.3B)、LingBot-World 2.0 Bidirectional 和 LingBot-World 2.0 Causal Pretrain。
这一次,我们首先希望解决一个更直接的问题:当世界模型已经能够长时间持续生成、实时响应操作并不断创造新事件,怎样让更多开发者真正把它跑起来?
1.3B 小模型面向消费级单卡 GPU,可在单卡上实现实时世界生成;Bidirectional 与 Causal Pretrain 则进一步开放模型蒸馏和因果预训练能力。我们希望让 LingBot-World 2.0 不仅可以被体验,也更容易被运行、研究和改进。
从持续生成一个世界,到让更多人把它跑起来
LingBot-World 2.0 是一个实时交互世界模型。在此前 7 月发布的 14B 主模型中,我们重点推进了长时序稳定性、实时生成和交互能力。模型支持小时级连续生成,并可以响应攻击、射箭、施法、射击等角色动作,以及下雪、下雨等环境事件。Pilot Agent 与 Director Agent 组成的 Agentic Interaction Harness,则协同完成角色行为与环境内容生成,让世界在探索过程中继续演化。在更高算力与相应推理配置下,LingBot-World 2.0 可进一步达到 720P / 60FPS 的高清实时体验。
然而,持续生成高清画面,并及时响应用户操作,仍对算力、显存和推理系统提出了较高要求。对于个人开发者、高校实验室和小型团队而言,能够看到一个世界模型,并不等于能够在本地运行它。这正是我们此次首先希望改变的事情。
1.3B 小模型:让实时世界跑上消费级单卡
本次开源的 LingBot-World 2.0 Small 采用 1.3B 参数规模,面向消费级单卡 GPU 设计,可在单卡上实现实时生成。
模型变小所带来的变化,不只是一组参数数字。过去,开发者可能更多通过公开视频或在线 Demo 观察世界模型的能力;现在,他们可以在本地直接运行模型,观察连续生成过程,修改输入方式,测试不同的交互设计,并搭建应用原型。
这让个人开发者、高校实验室和小型团队也可以从本地体验和复现开始,进一步探索交互方式、推理优化与场景应用。
Bidirectional:为更轻、更快的模型提供蒸馏源
仅仅开放一个可以直接运行的小模型,还不足以支持社区继续训练和改进世界模型。因此,本次我们同步开放 LingBot-World 2.0 Bidirectional,即双向 Teacher 模型。
它面向实时世界模型训练,提供高质量的蒸馏源。高质量生成通常需要多步去噪,计算成本较高,难以直接满足实时交互需求。通过蒸馏,可以将 Teacher 的多步生成轨迹压缩到少步 Student,在降低生成成本的同时,尽可能保留预训练阶段学习到的动作条件动态能力。
在 LingBot-World 2.0 的技术路径中,我们结合一致性蒸馏与分布匹配蒸馏:前者用于减少去噪步数,后者进一步改善视觉保真度,并抑制 Student 在长时序自回归过程中不断累积误差。
通过开放 Bidirectional,我们希望为研究者提供更完整的蒸馏起点,用于训练更轻、更快,或更适合特定场景的 Student 模型。
Causal Pretrain:开放世界模型的因果预训练底座
本次开放的第三款模型是 LingBot-World 2.0 Causal Pretrain。它面向后训练、评测和场景适配,提供因果预训练底座。
在 LingBot-World 2.0 中,当前世界状态只依赖过去的视觉观察,以及截至当前时刻的用户输入,不能访问未来信息。Causal Pretrain 支持相机位姿与文本提示(Prompt)两类输入,让用户既可以控制移动和视角,也可以通过文本改变局部事件与世界状态。
为了兼顾自回归生成与视觉质量,我们引入 Mixture of Bidirectional and Autoregressive Attention Mask(MoBA)。它在 Teacher Forcing 掩码中加入双向注意力组件,用于缓解纯 Teacher Forcing 带来的过拟合和画质下降,并帮助模型从双向生成过渡到自回归生成。与之配套的因果交叉注意力,则用于防止未来语义泄漏,同时保留灵活的交互控制能力。
技术报告中的定性对比显示,Causal Pretrain Backbone 在较长生成过程中能够更好地保持清晰纹理、稳定几何结构和场景连贯性,为后续实时模型提供更稳定的预训练基础。
(来源:蚂蚁灵波科技)