当前位置:

首页 > 硬件相关 > 每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

现在,请大家一起来数一下"1"、"2"。OK,仅仅2秒的时间,一个接近万亿规模的MoE大模型就已经掌握了如何解答一道高等数学难题的方法!而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。这就是华为借助"昇腾+PanguUltraMoE"这一组合实现的成果——不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。有多顶尖?来看一组数据:预训练阶段:昇腾Atlas800TA2万卡集群的MFU提升

现在,请大家一起来数一下 "1"、"2"。

OK,仅仅 2 秒的时间,一个接近万亿规模的 MoE 大模型就已经掌握了如何解答一道高等数学难题的方法!

而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。

 每 2 秒吃透一道高数大题!华为终于揭秘准万亿 MoE 昇腾训练系统全流程

这就是华为借助" 昇腾 +Pangu Ultra MoE"这一组合实现的成果——

不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。

有多顶尖?来看一组数据:

预训练阶段:昇腾 Atlas 800T A2 万卡集群的 MFU 提升至 41%

后训练阶段:单 CloudMatrix 384 超节点的吞吐量达到 35K Tokens/s

值得一提的是,华为这次公开了一项重要的技术细节。

具体而言,在昇腾 CloudMatrix 384 超节点上,华为披露了高效连接大稀疏比 MoE 强化学习后训练框架的关键技术。

这一举动标志着以强化学习(RL)为核心的后训练进入了超节点集群的新纪元。

不用 GPU 的 " 锻造 " 准万亿大模型的方式

在深入探讨华为 Pangu Ultra MoE 训练系统全流程之前,咱们先回顾一下目前的技术难点。

总体来看,在当前的 MoE 预训练和强化学习后训练过程中遇到的挑战可以归纳为六点:

并行策略配置复杂

面对数据并行、张量并行、专家并行、流水线并行和序列并行等多种策略的选择,加上稀疏激活导致的负载不均衡问题,很难仅凭人工经验找到最佳的并行配置方案。

All-to-All 通信瓶颈

专家并行架构需要进行大规模的 token 路由交换,这不仅占用了大量的网络带宽资源,还会使计算资源长时间处于空闲等待状态,极大影响整体训练效率。

系统负载分布不均衡

从注意力机制中序列长度的变化,到专家激活频率的不一致,再到流水线并行各阶段的负载分配问题,这些多层次的不均衡现象拖慢了整个集群的性能表现。

算子调度开销过高

动态路由机制引入了大量的高频小规模算子操作,增加了系统调度负担,减少了核心矩阵计算的比例,从而显著降低了 NPU 的有效利用率。

训练流程管理繁杂

强化学习后训练涉及多个模型实例和多种训练任务,包括 MoE 大模型的训练和推理阶段,整个流程的复杂性给资源分配和系统调度带来了巨大挑战。

大规模扩展受限

强化学习过程中,训练与推理阶段的参数重新映射机制,以及各计算任务间复杂的数据通信流程,成为限制后训练大规模部署的主要障碍。

即便存在这么多难题,华为在这份技术报告中依旧提出了一套完整的端到端全流程解决方案。

第一步:提高训练集群的利用率

超大规模训练集群的有效部署是提升预训练系统性能的关键。

为此,华为团队通过并行策略智能选择、计算通信深度融合、全局动态负载平衡等技术创新,显著提高了集群整体训练效率。

首先是基于系统建模仿真的智能并行优化。

华为团队采用了如下的系统建模仿真框架,将原本需要大量人工试错的并行策略选择问题转化为精确的自动化搜索过程。

根据昇腾 800T A2 训练集群的硬件特性和约束条件,为 Pangu Ultra MoE 718B 模型确定了最优部署配置:

16 路流水线并行(Pipeline Parallelism)进行模型层间切分

8 路张量并行(Tensor Parallelism)专门处理注意力计算

32 路专家并行(Expert Parallelism)实现专家模块分布式计算

2 路虚拟流水线并行(Virtual Pipeline Parallelism)提升流水线效率

最终实现了与昇腾架构深度适配的最优化部署方案。

 每 2 秒吃透一道高数大题!华为终于揭秘准万亿 MoE 昇腾训练系统全流程

△训练系统建模仿真流程

其次是 Adaptive Pipe 前反向通算掩盖。

为了突破并行扩展中的通信瓶颈问题,华为团队创新设计了昇腾网络拓扑适配的分层 All-to-All 通信去冗余机制,结合细粒度前反向计算重叠编排,成功将大规模 MoE 训练中的专家并行通信开销降至接近零暴露(

层次化专家并行通信:华为给出了与昇腾训练集群拓扑深度适配的多级通信策略。首先在节点间进行去冗余的 token 收集操作,避免相同 token 在低带宽的跨节点链路上重复传输;随后利用节点内高带宽优势,通过 All-to-All 通信实现 token 的冗余分发。这一分层设计显著提升了专家并行的整体通信效率。

自适应细粒度前反向掩盖:针对分层专家并行通信特点,设计了基于虚拟流水线并行(VPP)的细粒度前反向重叠掩盖策略。相比业界 DualPipe 掩盖方案,该策略将权重内存占用减少一半。通过进一步拆解 MLP 模块计算流程,充分利用分层专家并行通信中各级带宽相对独立的特性,实现算子执行顺序的自适应调优,最终将专家并行通信几乎完全隐藏(未掩盖比例仅为 2%)。

最后是EDP Balance 全局动态负载均衡。

对于 MoE 模型,随着模型规模和集群规模的增长,专家计算、注意力计算以及各层间的负载不均衡问题相互叠加并被显著放大。当多种性能瓶颈同时出现时,通信同步等待会在系统中传播扩散,造成整体性能的严重恶化。

华为团队采用系统性的分析方法,深入剖析专家并行(EP)、数据并行(DP)、流水线并行(PP)各通信域中潜在的负载均衡挑战,提出了 EDP 全局负载均衡优化策略。

这个策略不仅通过专家负载预测和动态调节机制(如下图)实现设备间计算负载的精确平衡,还通过注意力数据重排技术进一步优化了数据并行域间的负载分布效果。

此外,团队将虚拟流水线并行(VPP)机制与硬件规格特点相结合,设计了最优混合并行架构,有效缓解了模型各层间计算负载分布不均的问题,大幅提升了整体训练效率。

 每 2 秒吃透一道高数大题!华为终于揭秘准万亿 MoE 昇腾训练系统全流程

△基于专家动态迁移的 EP 间负载均衡整体框架图第二步:释放昇腾单节点的算力

在昇腾超大规模集群优化取得突破性进展之后,华为团队将优化重点转移到底层算子计算效率的深度挖掘。

这一阶段的核心工作围绕昇腾架构深度适配的训练算子加速展开,通过减轻 Host 资源瓶颈以及实施内存优化策略,成功将微批处理规模(MBS)提升至原来的两倍。

同时团队还对算子调度下发链路进行了协同优化,最终实现了昇腾单节点算力的全面释放。

华为团队的 " 第二步 ",同样包含三个部分;首先就是昇腾亲和的训练算子加速。

在大模型训练计算过程中,FlashAttention、MatMul 以及 Permute/Unpermute 等向量操作算子的执行时间占据了算子总计算耗时的四分之三以上。

针对这些关键算子类型,华为团队充分利用昇腾微架构特性,通过算子流水线排布优化和数学等价冗余计算消除等核心技术手段,实现了训练算子性能的显著跃升。

其次是Host-Device 协同的算子下发优化。

针对同步型间歇性 Host-Bound 和系统性持续性 Host-Bound 问题,华为团队充分发挥昇腾 + 鲲鹏异构系统协同优势,构建了分层优化体系来实现高效算子调度:

对于同步型 Host-Bound 问题,不仅有效消除了同步操作引发的 Host 资源瓶颈,在无法完全规避同步的场景下,还通过优化鲲鹏处理器的算子下发与调度策略,显著降低了同步后的 Host-Bound 开销。

对于系统性 Host-Bound 问题,则采用增大微批处理规模(MBS)、鲲鹏 CPU NUMA 亲和性优化等多维度协同手段,大幅提升算子下发效率。

通过算法与系统的深度协同优化,华为团队成功将 MoE 模型训练中的 Host-Bound 占比控制在 2% 以下,为超大规模模型训练探索出了全新的技术范式。

最后是Selective R/S- 精准的内存手术方案。

华为团队构建了一个精密的内存优化框架:以丰富多样的通用化重计算策略和 Swap 机制作为 " 精密工具库 ",涵盖从模块级到张量级的细粒度优化选项;配合精心设计的自适应内存管理机制作为 " 智能调度平台 "。

这个

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 华为
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。