当前位置:

首页 > 业界资讯 > 32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

淘天集团和爱橙科技于9月12日正式发布了开源的大模型训练框架——Megatron-LLaMA。该框架的目标是使技术开发者能够更方便地提升大语言模型的训练性能,降低训练成本,并与LLaMA社区保持兼容性。测试结果显示,在32卡训练上,与在HuggingFace上直接获取的代码版本相比,Megatron-LLaMA能够实现176%的加速;在大规模训练上,Megatron-LLaMA几乎线性扩展,且对网络不稳定表现出较高的容忍度。目前,Megatron-LLaMA已在开源社区上线开源地址:https://git

淘天集团和爱橙科技于9月12日正式发布了开源的大模型训练框架——Megatron-LLaMA。该框架的目标是使技术开发者能够更方便地提升大语言模型的训练性能,降低训练成本,并与LLaMA社区保持兼容性。测试结果显示,在32卡训练上,与在HuggingFace上直接获取的代码版本相比,Megatron-LLaMA能够实现176%的加速;在大规模训练上,Megatron-LLaMA几乎线性扩展,且对网络不稳定表现出较高的容忍度。目前,Megatron-LLaMA已在开源社区上线

开源地址:https://github.com/alibaba/Megatron-LLaMA

大语言模型的卓越表现一次又一次地超出了人们的想象。在过去几个月里,LLaMA和LLaMA2向开源社区全面开放,为那些想要训练自己的大语言模型的人们提供了一个很好的选择。在开源社区中,已经有很多基于LLaMA开发的模型,包括续训/SFT(如Alpaca、Vicuna、WizardLM、Platypus、StableBegula、Orca、OpenBuddy、Linly、Ziya等)和从零开始训练(如Baichuan、QWen、InternLM、OpenLLaMA)的工作。这些工作不仅在各种大模型能力客观评测榜单上表现出色,同时也展示了在长文本理解、长文本生成、代码编写、数学求解等实际应用场景中的出色性能。此外,业界还出现了许多有趣的产品,例如LLaMA结合Whisper的语音聊天机器人、LLaMA结合Stable Diffusion的绘画软件,以及医学/法律领域的辅助咨询机器人等

尽管从 HuggingFace 上可以拿到 LLaMA 的模型代码,但用自己的数据训一个 LLaMA 模型对个人用户或中小型组织并不是一件低成本且简单的工作。大模型的体积和数据的规模,使得在普通的计算资源上无法完成有效的训练,算力和成本成为严重的瓶颈。Megatron-LM 社区的用户在这方面的诉求非常急迫。

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

淘天集团和爱橙科技在大模型应用上有着非常广阔应用场景,在大模型的高效训练上进行了非常多的投入。LLaMA 的问世,在数据处理、模型设计、微调及强化学习反馈调整等方面都给予了包括淘天集团和爱橙科技在内的许多公司非常多的启示,也助力业务应用场景取得了新的突破。因此,为了回馈整个 LLaMA 开源社区、促进中文预训练大模型开源社区的发展,让开发者们能够更方便地提升大语言模型的训练性能,降低训练成本,淘天集团联合爱橙科技将部分内部优化技术开源,发布 Megatron-LLaMA,期望与每一位合作伙伴共建 Megatron 及 LLaMA 生态。

Megatron-LLaMA 提供了一套标准的 Megatron-LM 实现的 LLaMA,并提供了与 HuggingFace 格式自由切换的工具,方便与社区生态工具兼容。Megatron-LLaMA 重新设计了 Megatron-LM 的反向流程,使得无论在节点数较少需要开较大梯度聚合(Gradient Accumulation, GA)、或是节点数较多必须使用小 GA 的场景,都能够取得卓越的训练性能。

  • 在 32 卡训练上,相比 HuggingFace 上直接获得的代码版本,Megatron-LLaMA 能够取得 176% 的加速;即便是采用 DeepSpeed 及 FlashAttention 优化过的版本,Megatron-LLaMA 仍然能减少至少 19% 的训练时间。
  • 在大规模的训练上,Megatron-LLaMA 相比较 32 卡拥有着几乎线性的扩展性。例如使用 512 张 A100 复现 LLaMA-13B 的训练,Megatron-LLaMA 的反向机制相对于原生 Megatron-LM 的 DistributedOptimizer 能够节约至少两天的时间,且没有任何精度损失。
  • Megatron-LLaMA 对网络不稳定表现出高容忍度。即便是在现在性价比较高的 4x200Gbps 通信带宽的 8xA100-80GB 训练集群(这种环境通常是混部环境,网络只能使用一半的带宽,网络带宽是严重的瓶颈,但租用价格相对低廉)上,Megatron-LLaMA 仍然能取得 0.85 的线性扩展能力,然而在这个指标上 Megatron-LM 仅能达到不足 0.7。

Megatron-LM 技术带来的高性能 LLaMA 训练机会

LLaMA是目前大语言模型开源社区中一项重要的工作。LLaMA在LLM的结构中引入了BPE字符编码、RoPE位置编码、SwiGLU激活函数、RMSNorm正则化以及Untied Embedding等优化技术,在许多客观和主观评测中取得了卓越的效果。LLaMA提供了7B、13B、30B、65B/70B的版本,适用于各类大模型需求的场景,也受到广大开发者的青睐。和许多其他开源大模型一样,由于官方只提供了推理版的代码,如何以最低成本开展高效训练,并没有一个标准的范式

Megatron-LM 是一种优雅的高性能训练解决方案。Megatron-LM 中提供了张量并行(Tensor Parallel,TP,把大乘法分配到多张卡并行计算)、流水线并行(Pipeline Parallel,PP,把模型不同层分配到不同卡处理)、序列并行(Sequence Parallel, SP,序列的不同部分由不同卡处理,节约显存)、DistributedOptimizer 优化(类似 DeepSpeed Zero Stage-2,切分梯度和优化器参数至所有计算节点)等技术,能够显著减少显存占用并提升 GPU 利用率。Megatron-LM 运营着一个活跃的开源社区,持续有新的优化技术、功能设计合并进框架中。

然而,开发基于Megatron-LM并不简单,特别是在昂贵的多卡机器上进行调试和功能验证更是十分昂贵的。Megatron-LLaMA首先提供了一套基于Megatron-LM框架实现的LLaMA训练代码,支持各种规模的模型版本,并且可以简单地适配支持LLaMA的各种变种,包括直接支持HuggingFace格式的Tokenizer。因此,Megatron-LLaMA可以轻松应用于现有的离线训练链路中,无需进行过多的适配。在中小规模训练/微调LLaMA-7b和LLaMA-13b的场景中,Megatron-LLaMA能够轻松达到业界领先的54%以上的硬件利用率(MFU)

Megatron-LLaMA 的反向流程优化

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

需要重新书写的内容是:图示:DeepSpeed ZeRO 阶段-2

DeepSpeed ZeRO 是微软推出的一套分布式训练框架,其中提出的技术对很多后来的框架都有非常深远的影响。DeepSpeed ZeRO Stage-2(后文简称 ZeRO-2)是该框架中一项节约显存占用且不增加额外计算量和通信量的技术。如上图所示,由于计算需要,每个 Rank 都需要拥有全部的参数。但对于优化器状态而言,每个 Rank 只负责其中的一部分即可,不必所有 Rank 同时执行完全重复的操作。于是 ZeRO-2 提出将优化器状态均匀地切分在每个 Rank 上(注意,这里并不需要保证每个变量被均分或完整保留在某个 Rank 上),每个 Rank 在训练进程中只负责对应部分的优化器状态和模型参数的更新。在这种设定下,梯度也可以按此方式进行切分。默认情况下,ZeRO-2 在反向时在所有 Rank 间使用 Reduce 方式聚合梯度,而后每个 Rank 只需要保留自身所负责的参数的部分,既消除了冗余的重复计算,又降低了显存占用。

Megatron-LM DistributedOptimizer

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

原生 Megatron-LM 通过 DistributedOptimizer 实现了类似 ZeRO-2 的梯度和优化器状态切分,以减少训练中的显存占用。如上图所示,DistributedOptimizer 在每次获得预设的梯度聚合过的所有梯度后,通过 ReduceScatter 算子,将之前累积的全部梯度分发到不同的 Rank。每个 Rank 只获得自己需要处理的部分梯度,而后进行优化器状态的更新和对应参数的更新。最后各个 Rank 通过 AllGather 的方式从其他节点上获取更新过的参数,最终取得全部的参数。实际训练的结果显示,Megatron-LM 的梯度和参数通信与其他计算串行进行,对于大规模预训练任务,为了保证总批数据大小不变,通常无法开启较大的 GA。于是通信占比会伴随机器增加上升,这时候串行通信的特点导致扩展性很弱。在社区内,这方面的需求也很迫切

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

Megatron-LLaMA OverlappedDistributedOptimizer

为了解决这一问题,Megatron-LLaMA 改进了原生 Megatron-LM 的 DistributedOptimizer,使其梯度通信的算子能够可以和计算相并行。特别的,相比于 ZeRO 的实现,Megatron-LLaMA 在并行的前提下,通过巧妙的优化优化器分区策略,使用了更具有具有扩展性的集合通信方式来提升扩展性。OverlappedDistributedOptimizer 的主要设计保证了如下几点:a) 单一集合通信算子数据量足够大,充分利用通信带宽;b) 新切分方式所需通信数据量应等于数据并行所需的最小通信数据量;c) 完整参数或梯度与切分后的参数或梯度的转化过程中,不能引入过多显存拷贝。

32卡176%训练加速,开源大模型训练框架Megatron-LLaMA来了

具体而言,Megatron-LLaMA对DistributedOptimizer进行了改进,提出了OverlappedDistributedOptimizer,用于在训练的反向流程中结合新的切分方式进行优化。如图所示,在初始化OverlappedDistributedOptimizer时,会预先为所有参数分配它们所属的Bucket。每个Bucket中的参数是完整的,一个参数只属于一个Bucket,一个Bucket中可能有多个参数。在逻辑上,每个Bucket将被连续地等分为P份(P为数据并行组的数量),数据并行组中的每个Rank将负责其中的一份

Bucket被放置在本地梯度桶队列中,以确保通信顺序。在进行训练计算的同时,数据并行组之间以桶为单位,通过集合通信交换各自所需的梯度。在Megatron-LLaMA中,Bucket的实现尽可能地采用了地址索引,只有在需要更改值时才会分配新的空间,以避免显存浪费

通过结合大量的工程优化,上述设计使得在大规模训练时,Megatron-LLaMA能够充分利用硬件,实现比原生的Megatron-LM更好的加速效果。在常用的网络环境中,将训练规模从32张A100卡扩展到512张A100卡,Megatron-LLaMA仍能够达到0.85的扩展比

Megatron-LLaMA 的未来计划

Megatron-LLaMA是一个由淘天集团和爱橙科技共同开源并提供后续维护支持的训练框架,在内部已经得到广泛应用。随着越来越多的开发者加入LLaMA的开源社区并贡献可供互相借鉴的经验,相信未来在训练框架层面会面临更多挑战和机会。Megatron-LLaMA将密切关注社区的发展,并与广大开发者共同推动以下方向的发展:

  • 自适应最优配置选择
  • 更多模型结构或局部设计改动的支持
  • 在更多不同类硬件环境下的极致性能训练解决方案

项目地址:https://github.com/alibaba/Megatron-LLaMA

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯
相关文章 更多
腾讯智能体开源升级,关键科技全面开放
腾讯智能体开源升级,关键科技全面开放

不谈智能体,客户都不见你。腾讯云副总裁、腾讯云智能负责人、腾讯优图实验室负责人吴运声在采访中坦言。这意味着,如今提供云服务,若没有智能体相关的硬核能力,已难以打动客户。在2025腾讯全球数字生态大会上,腾讯云给出了自己的回应:正式发布智能体开发平台3.0(ADP3.0),并宣布腾讯优图实验室的关键智能体技术将逐步开源。据悉,该版本历经近三个月集中迭代,累计上线近600项功能,在RAG能力、Workflow流程、多智能体协作、应用评测及插件生态等方面实现全面升级。更值得关注的是,腾讯云透露未来数月将持续开源

Tachyum发布TDIMM内存技术 单条带宽281GB/s
Tachyum发布TDIMM内存技术 单条带宽281GB/s

11月26日,据相关报道,Tachyum正式推出其全新研发的TDIMM内存技术,旨在为人工智能与高性能计算领域带来更高带宽、更大容量及更低功耗的先进解决方案。该技术基于Tachyum旗下的ProdigyUltimate处理器平台构建,单条TDIMM模块可实现高达281GB/s的带宽,相较当前主流的DDR5内存提升了约5.5倍。ProdigyUltimate处理器支持多达24个内存通道,使系统总带宽达到惊人的6.7TB/s,约为传统12通道CPU系统的11倍水平。在存储容量方面,标准版TDIMM提供

惠普G5喷墨技术发布,引领家用打印新体验
惠普G5喷墨技术发布,引领家用打印新体验

9月23日,2025惠普创新喷墨打印技术媒体分享会在北京圆满举行。惠普正式发布全新一代G5喷墨打印技术,并推出多款面向家庭学习、办公应用及照片打印的全新产品,致力于为中国用户打造更智能、更稳定的打印体验。据悉,G5技术采用先进的墨滴精准控制技术和优化升级的黑色墨水配方,显著提升输出品质,使文字边缘更锐利、图像色彩更逼真。同时具备防荧光笔渗透、防水防褪色等实用性能。其打印头寿命长达2000小时不堵塞,相比上一代延长50%,大幅降低维护频率与使用成本,切实解决家庭用户的日常困扰。此次惠普还

“畅享绣”APP上线App Store,iOS用户开启智能刺绣新体验
“畅享绣”APP上线App Store,iOS用户开启智能刺绣新体验

近日,兄弟(中国)商业有限公司宣布其智能刺绣设计应用“畅享绣”已完成iOS系统适配及操作体验优化,现已正式上线AppStore。苹果用户可通过iPhone或iPad设备,便捷地将手绘图案转化为刺绣作品,以科技力量赋能传统工艺,开启全民创意刺绣新纪元。此次iOS版本的发布,意味着“畅享绣”已全面覆盖安卓与苹果两大移动平台,使更多用户能够随时随地享受刺绣的乐趣。该应用程序致力于降低专业门槛,让每一位用户都能成为生活中的艺术创作者。以往,个性化刺绣需要依赖专业软件,操作繁琐。而“畅享绣”只需

美团推出首个语音GUI智能体,端到端语音训练更优
美团推出首个语音GUI智能体,端到端语音训练更优

只需动动嘴,就能操控GUI代理?由美团与浙江大学联合推出的GUIRoboTron-Speech——让你彻底解放双手,直接对设备“发号施令”。这是首个可以直接通过语音指令和屏幕截图进行端到端(End-to-End)决策的自主GUI智能体,致力于为用户提供更自然、高效且无障碍的人机交互方式。从文本到语音,智能代理的新一轮进化目前,基于大语言模型(LLMs)的自主GUI智能体已经能够通过文本指令自动完成跨应用、多步骤的复杂操作,显著提升用户效率。然而,这种依赖文本输入的方式在某些场景中存在明显局限

CVPR 2025 具身智能研讨会挑战赛启动
CVPR 2025 具身智能研讨会挑战赛启动

2025年CVPR会议:首届具身智能通用机器人操作研讨会及挑战赛(GRAIL)全球顶级计算机视觉与人工智能会议CVPR将于2025年6月11日至15日在美国田纳西州举行。届时,INRIA、华盛顿大学、MBZUAI等顶尖机构将联合举办首届具身智能通用机器人操作研讨会和挑战赛(GRAIL)。该研讨会旨在攻克机器人操作的通用性难题,推动通用机器人技术发展。研讨会亮点:聚焦挑战:真实世界机器人操作面临诸多挑战,例如处理多样化物体、适应不同场景变化以及执行未知任务。GRAIL研讨会将汇聚计算机视觉、

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

比特现金未来:可扩展性与支付潜力
比特现金未来:可扩展性与支付潜力

比特现金(BCH)的未来发展前景看好。凭借其可扩展性、支付采用、价值存储、智能合约和坚实的社区支持,比特现金有望在多个领域取得显著发展,成为一种多功能且广泛使用的加密货币。

ACH总量10亿,价值与用途详解
ACH总量10亿,价值与用途详解

ACH 总共发行了 10 亿枚,用于支付网关费用、治理投票和质押奖励。ACH 基于 BEP-20 标准,采用 PoS 机制,可通过私募、公募和生态系统分配获取,其价值受服务需求、实用性和市场趋势影响,可在币安、火币等交易所购买。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。