首页
资讯
品牌
评测
选购
租赁
机库
组件
算力
视频
赛事
专题
人物
展会
社区
排行
------
反馈
科技资讯
摩尔线程万卡集群落地 236B MoE 模型训练实践
2026-07-22 18:32:06   具身之家综合

2026 世界人工智能大会期间,国产全功能 GPU 厂商摩尔线程正式披露 MoE-236B 混合专家大模型完整训练成果,依托自研 “夸娥” 万卡级智算集群完成全链路从零训练,集群有效训练时长占比突破 90%,标志国产自主算力基础设施具备支撑千亿级前沿大模型规模化训练的完整能力,补齐国内超大规模 AI 训练底层短板。

本次披露的 236B MoE 模型是国内少数依托纯国产万卡集群独立完成全流程预训练的混合专家基座模型,训练依托超 25T 高质量多维度语料,覆盖通用文本、多模态图文、行业专业数据,完整走完基础预训练、持续预训练、长窗口优化全流程,无需依赖海外算力设备分段迁移训练。万卡规模集群训练最大痛点在于节点故障、通信延迟导致任务频繁中断,此前国产芯片集群万卡级稳定训练占比普遍不足 70%,摩尔线程通过自研 MUSA 底层软件栈、DeepEP 专属 MoE 通信库与 MTT C256 高密度超节点架构三重优化,将集群有效训练时长稳定控制在 90% 以上,线性扩展效率最高达 95%,接近国际主流高端算力集群标准。

从训练精度维度看,摩尔线程同步公布对标测试数据:在同架构 MoE 模型训练实验中,国产集群与海外旗舰 GPU 平台前 3 万训练步平均相对误差仅万分之六,模型 MMLU 评测分数、训练损失曲线高度对齐国际基准,不存在国产算力训练带来的精度衰减问题,彻底打消行业对 “国芯训国模” 效果不足的质疑。针对 MoE 架构多专家路由带来的通信损耗,企业原生适配 Per-Block FP8 低精度训练方案,搭配算子融合、动态负载均衡技术,大幅提升千亿稀疏模型算力利用率,集群 MoE 模型算力利用率稳定维持 40% 区间,满足长期连续训练需求。

支撑本次 236B 模型训练的 “夸娥” 智算底座,搭载万片 MTT S5000 全功能 GPU,总算力规模达 10EFLOPS,配套 KUAE 全套 AI 训练套件,原生兼容 PyTorch、DeepSpeed、Megatron-LM 等主流训练框架,可无缝适配国内主流大模型研发路线。现场同步展出 MTT C256 超节点硬件方案,采用单柜 128 卡高密度无缆互联架构,解决传统多层网络带宽损耗、高延迟难题,为十万卡级智算中心建设提供标准化硬件方案。

除 236B MoE 基座模型外,摩尔线程万卡集群还完成多项前沿模型训练落地:联合北京大学完成全球首个 5D 物理世界模型 EvoPhys-World 全栈原生训练,该模型连续 37 天登顶斯坦福 WorldScore 世界生成榜单;协同北京智源研究院基于千卡集群完成通用具身智能大脑 RoboBrain 2.5 训练,覆盖人形机器人、自动驾驶物理 AI 研发场景,证明国产算力可同时支撑语言、视觉、具身多赛道超大模型开发。

长期以来,国内千亿参数大模型训练高度依赖海外高端 GPU,算力自主可控存在明显短板,多数国产 GPU 仅局限于推理场景使用。本次摩尔线程 236B MoE 模型万卡集群稳定训练落地,验证 “国产芯片 + 国产软件栈 + 国产集群” 全栈自主路线可行性,打破海外算力在超大规模模型训练领域的垄断格局。行业分析指出,90% 以上有效训练时长意味着国产集群可承接数月不间断长周期训练任务,大幅降低国内大模型企业算力采购、跨境数据传输成本,加速通用大模型、具身智能、物理 AI 等前沿技术产业化落地。

摩尔线程相关负责人表示,后续将持续迭代夸娥智算集群,推进万亿参数 MoE 模型训练验证,同步完善 “模型训练、词元生产、智能体生产” 三大 AI 工厂产业布局,依托全栈国产算力底座,为国内 AI 企业提供自主可控、低成本、高稳定的大规模模型训练基础设施,助力国内 AI 产业摆脱外部算力约束,构建完整自主算力生态体系。


友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有