近期,小红书 Dots Infra 团队正式开源多模态大模型训练系统 BigMac,直击行业长期存在的核心痛点:传统多模态训练方案普遍陷入帕累托取舍,想要提升训练吞吐速度,就要承受更高显存开销;若严控显存占用,又会产生大量算力空泡、拖慢整体效率。BigMac 依托全新调度范式,尝试把显存优化与训练提速从 “二选一” 的博弈中解放出来,为图文、音视频多模态大模型规模化训练提供全新工程路径。
随着多模态大语言模型快速普及,模型架构由语言主干、视觉编码器、生成模块共同组成,不同组件计算时长差异显著,给分布式流水并行带来巨大挑战。当前主流方案分化为两条路线:一类偏向计算优先,将各模态模块独立调度,减少算力等待,但激活显存会随微批次数量持续上涨,极易触发显存溢出;另一类侧重显存节约,把全部模块串联在同一流水线,缩短激活张量生命周期,一旦编码器出现计算延迟,整条训练链路陷入阻塞,形成大量 GPU 空闲空泡。长期以来,研发团队只能结合硬件资源条件,在两种路线之间被动权衡。
BigMac 提出依赖安全的嵌套流水线架构,也是整套系统最核心的创新。方案保留经过产业验证的 LLM 流水线作为调度主干,不再推翻成熟的 1F1B 等调度机制,在不打乱语言模型执行时序的前提下,把编码器、生成器的计算任务有序嵌入主干流程。该设计实现双重收益:模态模块的计算波动不会传导至 LLM 主干造成连锁等待,同时在算法层面将编码器、生成器激活显存复杂度降至 O (1),伴随全局批次规模扩大,显存占用依旧保持平稳。
实测数据显示,BigMac 具备显著的综合性能优势。在多模态理解、多模态生成两类典型负载下,相较于偏向显存优化的 Megatron-DistTrain 基线,训练速度提升 1.6 倍至 1.9 倍;对比侧重计算效率的 Optimus 基线,实现 1.08 至 1.1 倍加速。更关键的是,扩大训练批次规模时不会出现显存急剧攀升,大幅缓解大规模集群训练过程中 OOM(显存溢出)难题,让中小型研究团队也能够利用现有硬件资源训练更大规模多模态模型。
在工程落地层面,BigMac 充分考虑开源生态适配门槛。系统完成全局调度与运行时执行解耦,配套完整接口、仿真与性能可视化分析工具链。算法开发者仅需要定义各模块输入输出依赖,无需深度改造分布式底层逻辑,单卡验证的多模态模型,能够顺滑拓展至流水线并行集群。目前 BigMac 已经深度集成在小红书自研 Dots 多模态训练体系,长期支撑平台图文理解、多媒体生成类模型的线上迭代,经过真实业务场景规模化验证。
行业视角来看,多模态大模型、端到端原生多模态、多模态智能体持续成为竞争焦点,训练框架的底层调度能力,直接决定模型迭代成本。过去业内优化重心大多集中在模型算法、算子加速、通信压缩,针对多模态异构组件的流水线调度创新相对稀缺。BigMac 开源,补齐了分布式训练系统的一块短板,为开源社区提供可复用、经过生产验证的调度方案。
业内分析认为,BigMac 的价值不止于一组性能指标,更在于打破固有认知:多模态训练不必困在显存与速度的取舍边界。对于互联网企业、科研机构而言,这套方案可以降低多模态模型训练的硬件门槛,缩短迭代周期。随着代码全面开放,更多开发者能够在此基础上持续迭代,推动多模态大模型训练框架走向更高资源利用率,加速原生多模态模型技术创新与落地。