当前位置:

首页 > 业界资讯 > 扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

通常情况下,大型预训练模型的文本长度是固定的。如果想要支持更长的文本,就需要对模型进行微调。然而,训练具有长上下文的语言模型的计算成本非常高,需要大量的训练时间和GPU资源举个例子,如果要训练一个具有8192长度上下文的模型,相比于2048长度上下文,需要16倍的计算资源。尽管如此,上下文长度对于模型性能非常重要,因为它代表了LLM在回应时对整个上下文的清晰理解能力最近,麻省理工学院与香港中文大学合作研究,提出了LongLoRA。这是一种高效的微调方法,能够在有限的计算成本下扩展预训练的大型语言模型的上下

通常情况下,大型预训练模型的文本长度是固定的。如果想要支持更长的文本,就需要对模型进行微调。然而,训练具有长上下文的语言模型的计算成本非常高,需要大量的训练时间和GPU资源

举个例子,如果要训练一个具有8192长度上下文的模型,相比于2048长度上下文,需要16倍的计算资源。尽管如此,上下文长度对于模型性能非常重要,因为它代表了LLM在回应时对整个上下文的清晰理解能力

最近,麻省理工学院与香港中文大学合作研究,提出了LongLoRA。这是一种高效的微调方法,能够在有限的计算成本下扩展预训练的大型语言模型的上下文大小

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

论文地址:https://arxiv.org/pdf/2309.12307.pdf

项目地址:https://github.com/dvlab-research/LongLoRA 可以在这个链接上找到项目

本文旨在加快LLM的上下文扩展,从两个方面进行了改进

一方面,尽管在推理过程中需要密集的全局注意力,但通过稀疏的局部注意力可以有效且高效地对模型进行微调。本文提出的"移动短注意力"方法有效地实现了上下文扩展,节省了大量的计算,与使用传统的注意力机制进行微调的性能相似

另一方面,LoRA在可训练嵌入和归一化的前提下,在上下文扩展方面表现出色。LongLoRA在LLaMA2模型的各种任务中,从7B/13B扩展到70B,都展现出了很好的结果。在单台8x A100设备上,LongLoRA将LLaMA2 7B的上下文扩展到100k,LLaMA2 70B扩展到32k。LongLoRA扩展了模型的上下文,同时保留了其原始架构,并且与大多数现有技术兼容,如FlashAttention-2。为了使LongLoRA更实用,研究者收集了一个名为LongQA的数据集,用于监督微调。该数据集包含超过3k个长上下文问题-答案对

LongLoRA 是一种能够在注意力水平和权重水平上加速预训练大型语言模型上下文扩展的方法。以下是其亮点:

  • 短暂的注意力转移 易于实现,与 Flash-Attention 兼容,且在推理过程中不需要使用。
  • 发布了所有模型,包括从 7B 到 70B 的模型,上下文长度从 8k 到 100k,包括 LLaMA2-LongLoRA-7B-100k、LLaMA2-LongLoRA-13B-64k 和 LLaMA2-LongLoRA-70B-32k。
  • 建立了一个长上下文 QA 数据集 LongQA,用于监督微调。研究者已经发布了 13B 和 70B 32k 型号的 SFT、Llama-2-13b-chat-longlora-32k-sft 和 Llama-2-70b-chat-longlora-32k-sft,并将在下个月发布数据集。

LongLoRA 技术细节 

短暂的注意力转移

标准自注意力模式的计算开销为 O (n^2 ),使得长序列上的 LLM 内存开销高且速度慢。为了在训练中避免这个问题,本文提出了 shift short attention(S^2 -Attn),如下图 2 所示。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

研究人员验证了微调的重要性,如表1所示。如果不进行微调,在上下文长度增加的情况下,即使模型配备了适当的位置嵌入,其性能也会下降

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

现有的 efficient  attention 设计也可以提高长上下文语言模型的效率。在下表 2 中,研究者将 S^2 -Attn 与几种典型的 efficient  attention 进行了比较,可以发现,前者不仅能够实现高效的微调,还支持 full attention 测试。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

此外,S^2 -Attn 的实现非常简单,只需要两个步骤:(1) 转换半注意力头中的令牌 (2) 将令牌特征的维度移至批次维度。这个过程只需要几行代码即可完成

改进长距离低功耗广域网(LoRA)的内容

LoRA 是一种有效且流行的方法,可使 LLM 适应其他数据集。与完全微调相比,它节省了很多可训练参数和内存成本。然而,将 LLM 从短上下文长度调整为长上下文长度并不容易。研究者观察到 LoRA 和完全微调之间存在明显的差距。如下表 3 所示,随着目标上下文长度的增大,LoRA 和完全微调之间的差距也会增大。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

为了弥补这一差距,研究者打开嵌入层和归一化层进行训练。如表 3 所示,它们占用的参数有限,但对长上下文适应有影响。特别是归一化层,在整个 LLaMA2 7B 的参数占比仅为 0.004%。在实验中,研究者将这种改进的 LoRA 表示为 LoRA+。

实验及结果

研究者扩展了预训练的 7B、13B 和 70B LLaMA2 模型。7B 模型的最大扩展上下文窗口大小为 100k,13B 模型的最大扩展上下文窗口大小为 65536,70B 模型的最大扩展上下文窗口大小为 32768。 

研究者在研究中沿用了 Position Interpolation 的大部分训练超参数。不过,由于只使用了单台 8×A100 GPU 设备,在某些情况下批大小更小。所有的模型都通过预测下一个 token 来进行微调。研究者使用了 AdamW 优化器,其中 β_1 = 0.9,β_2 = 0.95。7B 和 13B 模型的学习率设定为 2 × 10^−5,而 70B 模型的学习率设定为 10^−5

他们还使用了线性学习率预热。权重衰减为零。每台设备的批大小设为 1,梯度累积步骤设为 8,这意味着使用 8 个 GPU,全局批大小等于 64。模型进行了 1000 步的训练。

研究者使用 Redpajama 数据集进行训练,并构建了一个长上下文 QA 数据集 LongQA,用于监督微调。Redpajama 微调的模型呈现了良好的困惑度,但它们的聊天能力是有限的。研究者收集了超过 3k 个问题 - 答案对,它们都是与技术论文、科幻小说和其他书籍等材料有关的。设计的问题包括总结、关系、人物等。

根据表格4,我们可以观察到在相同的训练和评估上下文长度下,随着上下文大小的增加,困惑度逐渐降低

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

在下表 5 中,研究者进一步考察了在单台 8×A100 设备上可微调的最大上下文长度。他们分别将 LLaMA2 7B、13B 和 70B 扩展到 100k、65536 和 32768 上下文长度。LongLoRA 在这些超大设置上取得了令人满意的结果。此外,实验还发现扩展模型在较小的上下文长度上会出现一些困惑度下降。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

在下表 6 中,研究者将模型与其他开放式 LLM 在 LongChat 中引入的主题检索任务上进行比较。这个任务是从很长的对话中检索目标话题,对话长度从 3k、6k、10k、13k 到 16k 不等。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

需要进行重新书写的内容是:消融实验

在第七个表格中,研究人员对LLaMA2 7B进行了不同类型的层细分。他们对FLOPs进行了分析:随着上下文长度的增加,全注意力机制的比例也急剧增加。例如,在上下文长度为8192时,全注意力机制占总FLOP的24.5%,而在上下文长度为65536时,增至72.2%。而当使用S^2-Attn时,比例下降至39.4%

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

下表8展示了在PG19验证集上扩展到8192上下文长度时,LLaMA2 7B模型的复杂度与微调步骤之间的关系。可以发现,如果不进行微调,在第0步时,模型的长上下文能力有限。完全微调比低阶训练收敛得更快。两者在200步后逐渐接近,最后没有出现大的差距

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

在微调过程中,不同的注意力模式的效果如下表2所示

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

内容展示

经过阅读《哈利・波特》的内容后,这个模型能够解释为什么斯内普对哈利不友好,甚至能够总结出人物之间的关系

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

不仅如此,给它一篇论文,还能帮助你立刻了解相关信息。

扩展LLaMA2上下文至100k:MIT和港中文采用LongLoRA方法

更多详细内容,请参阅原文。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程
每2秒解一道高数题!华为揭秘万亿MoE训练系统全流程

现在,请大家一起来数一下"1"、"2"。OK,仅仅2秒的时间,一个接近万亿规模的MoE大模型就已经掌握了如何解答一道高等数学难题的方法!而且呢,这个大模型还是完全依靠国产设备进行训练的,整个流程都体现了浓浓的“国产”特色。这就是华为借助"昇腾+PanguUltraMoE"这一组合实现的成果——不仅达成了国产算力与国产模型在全流程上的自主可控训练闭环,还在集群训练系统的性能方面达到了行业顶尖水平。有多顶尖?来看一组数据:预训练阶段:昇腾Atlas800TA2万卡集群的MFU提升

美团推出首个语音GUI智能体,端到端语音训练更优
美团推出首个语音GUI智能体,端到端语音训练更优

只需动动嘴,就能操控GUI代理?由美团与浙江大学联合推出的GUIRoboTron-Speech——让你彻底解放双手,直接对设备“发号施令”。这是首个可以直接通过语音指令和屏幕截图进行端到端(End-to-End)决策的自主GUI智能体,致力于为用户提供更自然、高效且无障碍的人机交互方式。从文本到语音,智能代理的新一轮进化目前,基于大语言模型(LLMs)的自主GUI智能体已经能够通过文本指令自动完成跨应用、多步骤的复杂操作,显著提升用户效率。然而,这种依赖文本输入的方式在某些场景中存在明显局限

通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API
通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API

强化学习(RL)结合真实搜索引擎可以显著提升大模型的检索和推理能力。然而,这一方法面临两大挑战:搜索引擎返回的文档质量不稳定,导致训练过程中的噪音和不稳定性;RL训练需要频繁部署,产生大量API开销,限制了可扩展性。针对这些问题,阿里通义实验室推出了开源解决方案ZeroSearch,这是一个无需与真实搜索引擎交互的强化学习框架。实验表明,ZeroSearch只需使用3B参数的LLM作为检索模块,就能有效提升搜索能力,并大幅节省API成本。ZeroSearch让LLM实现自给自足

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第二代Ameca亮相!对答如流,表情逼真,多语种交流
第二代Ameca亮相!对答如流,表情逼真,多语种交流

编辑:桃子【新智元导读】第二代Ameca升级亮相,搭载GPT-4技术,实现实时对话。人形机器人Ameca迎来了它的第二代版本!近期,在2024年世界移动通信大会(MWC)上,全球最先进的机器人Ameca再度亮相。Ameca在会场周围吸引了大量观众。通过GPT-4的增强,Ameca能够即时回应各种问题。「展示一段舞蹈吧」。当被问及是否有情感时,Ameca通过一系列逼真的面部表情作出回应。就在几天前,开发Ameca的英国机器人公司EngineeredArts展示了他们团队的最新成果。视频中,Ameca具备了

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。