当前位置:

首页 > 业界资讯 > 算力就这么点,如何提升语言模型性能?谷歌想了个新点子

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

近年来,语言模型(LM)在自然语言处理(NLP)研究中变得更加突出,在实践中也越来越有影响力。一般来说,扩大模型的规模已被证明可以提升在一系列NLP任务中的性能。不过,扩大模型规模的挑战也是显而易见的:训练新的、更大的模型需要大量的计算资源。此外,新的模型往往是从头开始训练的,无法利用以前的模型的训练权重。对于这个问题,谷歌的研究人员探讨了两种互补的方法,在不额外消耗大量计算资源的情况下,大幅提高现有语言模型的性能。首先,在「TranscendingScalingLawswith0.1%Ext

近年来,语言模型(LM)在自然语言处理(NLP)研究中变得更加突出,在实践中也越来越有影响力。一般来说,扩大模型的规模已被证明可以提升在一系列NLP任务中的性能。

不过,扩大模型规模的挑战也是显而易见的:训练新的、更大的模型需要大量的计算资源。此外,新的模型往往是从头开始训练的,无法利用以前的模型的训练权重。

对于这个问题,谷歌的研究人员探讨了两种互补的方法,在不额外消耗大量计算资源的情况下,大幅提高现有语言模型的性能。

首先,在 「Transcending Scaling Laws with 0.1% Extra Compute」一文中,研究人员介绍了UL2R,这是一个轻量级的第二阶段预训练模型,使用一个混合enoisers目标。UL2R提高了一系列任务的性能,甚至在以前具有接近随机性能的任务上释放出突发性能。

论文链接:​https://arxiv.org/pdf/2210.11399.pdf​

另外,在「Scaling Instruction-Finetuned Language Models」中,探讨了在一个以指令为措辞的数据集上微调语言模型的问题,这个过程我们称为 "Flan"。这种方法不仅提高了性能,而且还提高了语言模型对用户输入的可用性。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

论文链接:​https://arxiv.org/abs/2210.11416​

最后,Flan和UL2R可以作为互补技术结合在一个名为Flan-U-PaLM 540B的模型中,该模型在一系列具有挑战性的评估基准中,比未经调整的PaLM 540B模型表现高出10%。

UL2R的训练

传统上,大多数语言模型都是在因果语言建模目标上进行预训练,使模型能够预测序列中的下一个词(如GPT-3或PaLM)或去噪目标,其中模型学习从损坏的单词序列中恢复原句(如T5)。

尽管在语言建模目标中存在一些权衡,即因果关系的语言模型在长句生成方面表现更好,而在去噪目标上训练的语言模型在微调方面表现更好,但在之前的工作中,研究人员表明,包括这两个目标的混合enoisers目标在两种情况下都能取得更好的性能。

不过,在不同的目标上从头开始对大型语言模型进行预训练,在计算上是很困难的。因此,我们提出了UL2修复(UL2R),这是一个用UL2目标继续预训练的附加阶段,只需要相对较少的计算量。

我们将UL2R应用于PaLM,并将产生的新语言模型称为U-PaLM。

在实证评估中,我们发现,只需少量的UL2训练,模型就会有大幅改善。

例如,通过在PaLM 540B的中间检查点上使用UL2R,可以达到PaLM 540B在最终检查点的性能,同时使用了2倍的计算量。当然,将UL2R应用于最终的PaLM 540B检查点也会带来巨大的改进。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

PaLM 540B和U-PaLM 540B在26个NLP基准上的计算与模型性能对比。U-PaLM 540B继续训练PaLM,计算量非常小,但在性能上有很大的提升。

使用UL2R的另一个好处是,它在一些任务上的性能比纯粹在因果语言建模目标上训练的模型好得多。例如,有许多BIG-Bench任务具备所谓「新兴能力」,即只有在足够大的语言模型中才有的能力。

虽然最常见的发现新兴能力的方式是通过扩大模型规模,但UL2R实际上可以在不扩大模型规模的情况下激发新兴能力。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

比如在BIG-Bench的导航任务中,衡量模型进行状态跟踪的能力,除了U-PaLM,所有模型的训练FLOPs少于10^23个。另一个例子是BIG-Bench的Snarks任务,该任务衡量模型检测讽刺语言的能力。

对于来自BIG-Bench的两种能力,展示了新兴的任务性能,U-PaLM由于使用了UL2R目标,所以在较小的模型规模下实现了新兴性能。

指令微调

在第二篇论文中,我们探讨了指令微调,这涉及到在一组以指令为措辞的NLP数据集上对LM进行微调。

在之前的工作中,我们将指令微调应用于62个NLP任务的137B参数模型,比如回答一个小问题,对电影表达的情感进行分类,或者将句子翻译成西班牙语等。

在这项工作中,我们在超过1.8K的任务上微调了540B参数的语言模型。此外,以前的工作只对有少量例证的语言模型(如MetaICL)或无例证的零例证语言模型(如FLAN、T0)进行微调,而我们对两者的组合都进行了微调。

我们还包括思维链微调数据,这使得模型能够进行多步骤推理。我们把我们改进的方法称为 "Flan",用于微调语言模型。

值得注意的是,即使在1.8K的任务上进行微调,与预训练相比,Flan只用了一小部分的计算量(对于PaLM 540B,Flan只需要预训练计算量的0.2%)。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

在1.8K个以指令形式表述的任务上对语言模型进行微调,并在新任务上对模型进行评估,这些任务不包括在微调中。分别在有/无示例的情况下进行微调(即0-shot 和 few-shot),以及有/无思维链的情况下进行微调,使模型可以在一系列评估场景中推广开来。

本文中,一系列规模的LM进行了指令-微调,目的是研究同时扩大语言模型的规模和增加微调任务数量的共同效果。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

例如,对于PaLM类语言模型,包括8B、62B和540B参数规格。在四个具有挑战性的基准评估标准(MMLU、BBH、TyDiQA和MGSM)上评估了我们的模型,发现扩大参数数量和微调任务数量都能提高在此前未见的新任务上的性能表现。

扩大到540B的参数模型和使用1.8K的微调任务都能提高性能。上图y轴是四个评估套件(MMLU、BBH、TyDiQA和MGSM)的归一化均值。

除了更好的性能之外,指令微调LM能够在推理时对用户的指令做出反应,而不需要少量的示例或提示工程。这使得LM在一系列的输入中更加方便用户。例如,没有指令微调的LM有时会重复输入或不能遵循指令,但指令微调可以减轻这种错误。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

我们的指令微调语言模型Flan-PaLM与没有指令微调的PaLM模型相比,对指令的反应更好。

强强联合,实现「1+1>2」

最后,我们表明,UL2R和Flan可以结合起来训练Flan-U-PaLM模型。

由于Flan使用来自NLP任务的新数据,并能实现零点指令跟踪,我们将Flan作为UL2R之后的次选方法。

我们再次对四个基准套件进行评估,发现Flan-U-PaLM模型优于只有UL2R(U-PaLM)或只有Flan(Flan-PaLM)的PaLM模型。此外,当与思维链和自洽性相结合时,Flan-U-PaLM在MMLU基准上达到了新的SOTA,得分达到75.4%。

算力就这么点,如何提升语言模型性能?谷歌想了个新点子

与只使用UL2R(U-PaLM)或只使用Flan(Flan-U-PaLM)相比,将UL2R和Flan(Flan-U-PaLM)结合起来会带来最佳性能:四个评估套件(MMLU、BBH、TyDiQA和MGSM)的归一化平均值。

总的来说,UL2R和Flan是两种互补的方法,用于改进预训练的语言模型。UL2R使用相同的数据使LM适应denoisers的混合目标,而Flan则利用超过1.8K NLP任务的训练数据来教模型遵循指令。

随着语言模型变得更大,像UL2R和Flan这样无需大量计算就能提高一般性能的技术,可能会变得越来越有吸引力。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 谷歌
相关文章 更多
苹果15plus怎么传照片到电脑 苹果15plus传照片到电脑方法
苹果15plus怎么传照片到电脑 苹果15plus传照片到电脑方法

手机早已成为中青年人的标配,不同年龄段对手机的需求其实差别不小。iPhone 15 Plus 作为当前热度颇高的机型,功能与服务覆盖得相当全面,能满足各类用户的需求。不过,有个实用问题很多人都会遇到——怎么把照片传到电脑上?今天就把两种主流方法掰开揉碎讲清楚,看完你就知道该怎么操作了。 方法一:数据

机构:HBM爆发式增长,存储价格区间预计持续向
机构:HBM爆发式增长,存储价格区间预计持续向

AI硬件资本开支加速,2026年或达万亿美元。HBM爆发式增长,存储供不应求,DRAM和NAND价格大涨。AI算力市场“一超多强”,光芯片高速增长,存储从周期品变为战略资源。

谷歌亲儿子优先升级!安卓17正式版推送:21款设备首发尝鲜
谷歌亲儿子优先升级!安卓17正式版推送:21款设备首发尝鲜

谷歌正式推送安卓17系统,首批覆盖Pixel6至10系列共21款机型。新功能包括长按应用气泡菜单、应用内存限制机制、精确/大致定位权限选择,以及遗失设备追踪的FindHub功能,进一步优化隐私与设备管理体验。

小米 MIUI不再支持自行安装谷歌GMS服务
小米 MIUI不再支持自行安装谷歌GMS服务

这几天,一些MIUI用户发现手机装不上谷歌GMS(谷歌移动服务)了。这事儿怎么说呢?小米社区里,多位认证为解答组的人员给出了统一回复:国内版MIUI出于合规原因,没有预置Google服务框架的机型,以后不再支持用户自己安装GMS服务。解答组还贴心地补了一句——如果真要用,可以去酷安搜相关教程。 受影

Token低价陷阱
Token低价陷阱

大模型Token单价下降,但企业从简单问答转向复杂工作流,消耗量暴增,总支出膨胀。通用Token价格探底,高价值能力分层,利润在芯片、云平台等环节重新分配。

等了7年!Edge终于支持谷歌账号登录同步数据
等了7年!Edge终于支持谷歌账号登录同步数据

微软Edge浏览器计划于2026年7月直接支持谷歌账号登录,用户无需微软账号即可跨设备同步浏览器数据。此举为偏好Edge但不想使用微软账号的用户提供原生单点登录体验,无需再走间接路径。

小米MIXFold3如何安装谷歌 小米MIXFold3安装谷歌方法
小米MIXFold3如何安装谷歌 小米MIXFold3安装谷歌方法

小米MIXFold3未预装谷歌服务,需手动安装:先下载谷歌服务框架并开启未知来源,再安装GooglePlay商店并登录账号。但设备不支持完整GMS,部分应用可能有兼容性问题。

安卓手机忘记解锁密码怎么办?3招教你打开手机
安卓手机忘记解锁密码怎么办?3招教你打开手机

安卓手机忘记密码时,可通过三种方式解锁:一、开启USB调试后,用ADB命令删除密码文件;二、连续错误输入五次,利用绑定的谷歌账号重置;三、使用刷机软件清除锁屏密码。

提升流畅度:谷歌安卓17给App内存占用套上“紧箍咒”
提升流畅度:谷歌安卓17给App内存占用套上“紧箍咒”

安卓17引入四项重要安全改进:包括主动终止内存异常应用、新增本地网络权限防止设备扫描、强制动态加载库只读防止恶意注入、默认启用证书透明度防止伪造证书,全面提升系统安全。

接连两位大咖出走,谷歌到底出了什么BUG?
接连两位大咖出走,谷歌到底出了什么BUG?

不到一周内,谷歌两位核心人物诺姆·沙泽尔与约翰·江珀相继离职。谷歌在AIAgent领域明显落后,产品线混乱,Antigravity2.0表现差强人意。尽管评测分数领先,但任务交付能力不足,组织架构的割裂是根本原因。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。