当前位置:

首页 > 业界资讯 > 训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

深度学习领域已经取得了阶段性重大进展,特别是在计算机视觉、自然语言处理和语音等方面,使用大数据训练得到的大规模模型对于实际应用、提高工业生产力和促进社会发展具有巨大的前景。不过大模型也需要大算力才能训得动,随着人们对计算能力要求的不断提高,尽管已有许多研究探索高效的训练方法,但仍然没有对深度学习模型加速技术的全面综述。最近,来自悉尼大学、中国科学技术大学等机构的研究人员发布了一篇综述,全面总结了大规模深度学习模型的高效训练技术,展现了训练过程中的各个组件内的通用机制。论文链接:https://arxiv.

深度学习领域已经取得了阶段性重大进展,特别是在计算机视觉、自然语言处理和语音等方面,使用大数据训练得到的大规模模型对于实际应用、提高工业生产力和促进社会发展具有巨大的前景。

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

不过大模型也需要大算力才能训得动,随着人们对计算能力要求的不断提高,尽管已有许多研究探索高效的训练方法,但仍然没有对深度学习模型加速技术的全面综述。

最近,来自悉尼大学、中国科学技术大学等机构的研究人员发布了一篇综述,全面总结了大规模深度学习模型的高效训练技术,展现了训练过程中的各个组件内的通用机制。

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

论文链接:https://arxiv.org/pdf/2304.03589.pdf

研究人员考虑了最基本的权重更新公式,并将其基本组成部分划分为五个主要方面: 

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

1、以数据为中心(data-centric),包括数据集正则化、数据采样和以数据为中心的课程学习技术,可以显著降低数据样本的计算复杂性;

2、以模型为中心(model-centric),包括基本模块的加速、压缩训练、模型初始化和以模型为中心的课程学习技术,侧重于通过减少参数计算来加速训练;

3、以优化为中心(optimization-centric),包括学习率的选择、使用大batch size、高效目标函数的设计、模型加权平均技术等;侧重于训练策略以提高大规模模型的通用性;

4、预算训练(budgeted training),包括一些在硬件受限的情况下使用的加速技术;

5、以系统为中心(system-centric),包括一些高效的分布式框架和开源库,为加速算法的实现提供足够的硬件支持。

以数据为中心的高效训练

最近,大规模模型的进展大放异彩,而其对数据集的要求却急剧增加。巨大的数据样本被用来驱动训练过程并取得出色的性能。因此,以数据为中心的研究对实际加速至关重要。

数据处理(data processing)的基本作用是在不额外增加标注成本的情况下,高效地增加数据样本的多样性;由于数据标注的成本往往过于昂贵,部分开发机构无法负担,也凸显了以数据为中心领域的研究的重要性;同时,数据处理还注重提高数据样本的并行加载效率。

研究人员将所有这些对数据的高效处理称为「以数据为中心」(data-centric)的方法,可以显著提高训练大规模模型的性能。

文中从以下几个方面回顾和研究技术:

数据正则化 Data Regularization

数据正则化是一种预处理技术,通过一系列的数据变换来增强原始数据样本的多样性,可以提高训练样本在特征空间中的等效表示,不需要额外的标签信息的要求。

高效的数据正则化方法在训练过程中被广泛使用,能够显著提高大规模模型的泛化性能。

数据采样 Data sampling

数据采样也是一种有效的方法,从大批量的样本中选择一个子集来对梯度进行更新,它的好处是以小批量的训练的方式,可以减少当前批次中那些不重要的或不好样本的影响。

通常情况下,采样出来的数据是更重要的,性能与使用全批次训练得到的模型相当;每次迭代的概率需要随着训练过程逐渐调整,以确保采样没有偏差。

以数据为中心的课程学习 Data-centric Curriculum Learning

课程学习在训练过程的不同阶段研究渐进的训练设置,以减少整体的计算成本。

在开始的时候,使用低质量的数据集训练足以学习低层次的特征;然后使用高质量的数据集(更多的增强和复杂的预处理方法)逐渐帮助学习复杂的特征,并达到与使用整个训练集相同的精度。

以模型为中心的高效训练

设计高效的模型架构始终是深度学习领域最重要的研究之一,一个优秀的模型应当是一个高效的特征提取器,可以投射到容易分离的高级特征中。

与其他特别关注高效、新颖的模型架构的工作不同,这篇论文在「以模型为中心」的研究中更加关注通用模块的等价替代方案,在具有可比性的情况下实现更高的训练效率。

几乎所有的大型模型都是由小模块或层组成的,所以对模型的调研可以为高效训练大规模模型提供指导作用,研究人员主要从以下几个方面研究:

架构效率 Architecture Efficiency

随着深度模型中参数量的急剧增加,也带来了巨大的计算消耗,所以需要实现一个高效的替代方案来近似原始版本的模型架构的性能,这个方向也逐渐受到学术界的重视;这种替换不仅仅是数值计算的近似,还包括深度模型中的结构简化和融合。

研究人员根据不同的架构来区分现有的加速技术,并展示了一些观察和结论。

压缩训练效率 Compression Training Efficiency

压缩一直是计算加速的研究方向之一,在数字信号处理(多媒体计算/图像处理)中起着关键作用。

传统的压缩包括两个主要分支:量化和稀疏,文中详细说明了二者现有的成就和对深度训练的贡献。

初始化效率 Initialization Efficiency

模型参数的初始化在现有的理论分析和实际场景中都是一个非常重要的因素。

一个不好的初始化状态甚至会导致整个训练在早期的训练阶段崩溃和停滞,而一个好的初始化状态则有助于在一个平滑的损失范围内加快整个收敛的速度,文中主要从模型初始化的角度研究评估和算法设计。

以模型为中心的课程学习 Model-centric Curriculum Learning

从以模型为中心的角度来看,课程学习通常从大规模模型中的一个小模型或部分参数开始训练,然后逐渐恢复到整个架构;在加速训练过程中显示了较大优势,并且没有明显的负面效应,文中回顾了该方法在训练过程中的实现和效率。

以优化为中心的高效学习

优化方法的加速方案一直是机器学习领域的一个重要研究方向,在实现最优条件的同时降低复杂性一直是学术界追求的目标。

近年来,高效、强大的优化方法在训练深度神经网络方面取得了重要突破,作为机器学习中广泛使用的基本优化器,SGD类的优化器成功地帮助深度模型实现各种实际应用,不过随着问题的日益复杂,SGD更容易陷入局部最小值,无法稳定地泛化。

为了解决这些困难,Adam及其变种被提出来,在更新上引入自适应性,这种做法在大规模的网络训练中取得了良好的效果,例如在BERT、Transformer和ViT模型中都有应用。

除了所设计的优化器的自身性能外,对加速训练技术的组合也很重要。

研究人员基于优化的角度,将目前对加速训练的思考总结为以下几个方面:

学习率  Learning rate

学习率是非凸优化的一个重要的超参数,在当前的深度网络训练中也是至关重要的,像Adam及其变种这样的自适应方法,已经成功地在深度模型上取得了卓越的进展。

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

一些基于高阶梯度的调整学习率的策略也有效地实现了加速训练,学习率衰减的实现也会影响到训练过程中的性能。

大批尺寸 Large batchsize

采用更大的批处理量将有效地提高训练效率,能够直接减少完成一个epoch训练所需的迭代次数;在样本总量固定的情况下,处理一个更大的批尺寸比处理多个小批尺寸的样本来说消耗更低,因为可以提高内存利用率和降低通信瓶颈。

高效的目标 Efficient objective

最基础的ERM在最小化问题上起到关键作用,使得许多任务得以实际运用。

随着对大型网络研究的深入,一些作品更加关注优化和泛化之间的差距,并提出有效的目标以减少测试误差;从不同的角度解释泛化的重要性,并在训练中对其进行联合优化,可以大大加快测试的准确性。

加权平均  Averaged weights

加权平均是一种实用的技术,可以增强模型的通用性,因为考虑的是历史状态的加权平均,有一组冻结的或可学习的系数,可以大大加快训练进程。

预算化高效训练

最近有几项工作专注于用较少的资源训练深度学习模型,并且尽可能地实现更高的精度。

这类问题被定义为预算训练(budgeted training),即在给定的预算(对可测量成本的限制)下进行训练,以实现最高的模型性能。

为了系统地考虑硬件支持以接近真实情况,研究人员将预算训练定义为在给定的设备和有限的时间内进行训练,例如,在单个低端深度学习服务器上训练一天,以获得具有最佳性能的模型。

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

对预算内训练的研究可以阐明如何制作预算内训练的训练配方,包括决定模型大小、模型结构、学习率安排和其他几个影响性能的可调整因素的配置,以及结合适合可用预算的高效训练技术,文中主要回顾了预算训练的几项先进技术。

以系统为中心的高效训练

以系统为中心的研究就是为所设计的算法提供具体的实现方法,研究的是能够真正实现高效训练的硬件的有效和实际执行。

研究人员重点关注通用计算设备的实现,例如多节点集群中的CPU和GPU设备,从硬件的角度解决设计算法中的潜在冲突是关注的核心。

文中主要回顾了现有框架和第三方库中的硬件实现技术,这些技术有效地支持了数据、模型和优化的处理,并介绍一些现有的开源平台,为模型的建立、有效利用数据进行训练、混合精度训练和分布式训练提供了坚实的框架。

以系统为中心的数据效率 System-centric Data Efficiency

高效的数据处理和数据并行是系统实现中的两个重要关注点。

随着数据量的快速增加,低效的数据处理逐渐成为训练效率的瓶颈,尤其是在多节点上的大规模训练,设计更多对硬件友好的计算方法和并行化可以有效避免训练中的时间浪费。

以系统为中心的模型效率 System-centric Model Efficiency

随着模型参数数量的急剧扩大,从模型角度看,系统效率已经成为重要的瓶颈之一,大规模模型的存储和计算效率给硬件实现带来巨大挑战。

文中主要回顾如何实现部署的高效I/O和模型并行的精简实现,以加快实际训练的速度。

以系统为中心的优化效率 System-centric Optimization Efficiency

优化过程代表了每个迭代中的反向传播和更新,也是训练中最耗时的计算,因此以系统为中心的优化的实现直接决定了训练的效率。

为了清楚地解读系统优化的特点,文中重点关注不同计算阶段的效率,并回顾每个过程的改进。

开源框架 Open Source Frameworks

高效的开源框架可以促进训练,作为嫁接(grafting)算法设计和硬件支持的桥梁,研究人员调查了一系列开源框架,并分析了每个设计的优势和劣势。

训大模型讲究「化劲」!陶大程带队:一文打尽「高效训练」方案,别再说硬件是唯一瓶颈

结论

研究人员回顾了有效训练大规模深度学习模型的通用训练加速技术,考虑了梯度更新公式中的所有组件,涵盖了深度学习领域的整个训练过程。

文中还提出了一个新颖的分类法,将这些技术总结归类为五个主要方向:以数据为中心、以模型为中心、以优化为中心、预算训练和以系统为中心。

前四部分主要从算法设计和方法论的角度进行综合研究,而在「以系统为中心的高效训练」部分,从范式创新和硬件支持的角度总结了实际实现情况。

文中回顾并总结了与每个部分相对应的常用或最新开发的技术,每项技术的优势和权衡,并讨论局限性和有前景的未来研究方向;在提供全面的技术回顾和指导的同时,这篇综述还提出了当前高效训练的突破口和瓶颈。

研究人员希望能帮助研究人员高效地实现通用的训练加速,并为高效训练的未来发展提供一些有意义和有前景的影响;除了在每一节末尾提到的一些潜在的进展之外,更广泛的、有前景的观点如下:

1、 高效的Profile搜索

高效训练可以从数据增强组合、模型结构、优化器设计等角度出发,为模型设计预建的和可定制的profile搜索策略,相关研究已经取得了一些进展。

新的模型架构和压缩模式、新的预训练任务、对「模型边缘」(model-edge)知识的利用同样值得探索。

2、自适应调度器 Adaptive Scheduler

使用一个面向优化的调度器,如课程学习、学习速率和批次大小以及模型的复杂性,有可能实现更好的性能;Budget-aware调度器可以动态适应剩余预算,降低人工设计的成本;自适应调度器可以用来探索并行性和通信方法,同时考虑到更通用且实际的情况,例如在跨越多地区和数据中心的异构网络中进行大规模去中心化训练。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程
每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

现在,请大家一起来数一下"1"、"2"。OK,仅仅2秒的时间,一个接近万亿规模的MoE大模型就已经掌握了如何解答一道高等数学难题的方法!而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。这就是华为借助"昇腾+PanguUltraMoE"这一组合实现的成果——不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。有多顶尖?来看一组数据:预训练阶段:昇腾Atlas800TA2万卡集群的MFU提升

美团推出首个语音GUI智能体,端到端语音训练更优
美团推出首个语音GUI智能体,端到端语音训练更优

只需动动嘴,就能操控GUI代理?由美团与浙江大学联合推出的GUIRoboTron-Speech——让你彻底解放双手,直接对设备“发号施令”。这是首个可以直接通过语音指令和屏幕截图进行端到端(End-to-End)决策的自主GUI智能体,致力于为用户提供更自然、高效且无障碍的人机交互方式。从文本到语音,智能代理的新一轮进化目前,基于大语言模型(LLMs)的自主GUI智能体已经能够通过文本指令自动完成跨应用、多步骤的复杂操作,显著提升用户效率。然而,这种依赖文本输入的方式在某些场景中存在明显局限

通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API
通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API

强化学习(RL)结合真实搜索引擎可以显著提升大模型的检索和推理能力。然而,这一方法面临两大挑战:搜索引擎返回的文档质量不稳定,导致训练过程中的噪音和不稳定性;RL训练需要频繁部署,产生大量API开销,限制了可扩展性。针对这些问题,阿里通义实验室推出了开源解决方案ZeroSearch,这是一个无需与真实搜索引擎交互的强化学习框架。实验表明,ZeroSearch只需使用3B参数的LLM作为检索模块,就能有效提升搜索能力,并大幅节省API成本。ZeroSearch让LLM实现自给自足

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第二代Ameca亮相!对答如流,表情逼真,多语种交流
第二代Ameca亮相!对答如流,表情逼真,多语种交流

编辑:桃子【新智元导读】第二代Ameca升级亮相,搭载GPT-4技术,实现实时对话。人形机器人Ameca迎来了它的第二代版本!近期,在2024年世界移动通信大会(MWC)上,全球最先进的机器人Ameca再度亮相。Ameca在会场周围吸引了大量观众。通过GPT-4的增强,Ameca能够即时回应各种问题。「展示一段舞蹈吧」。当被问及是否有情感时,Ameca通过一系列逼真的面部表情作出回应。就在几天前,开发Ameca的英国机器人公司EngineeredArts展示了他们团队的最新成果。视频中,Ameca具备了

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。