当前位置:

首页 > 硬件相关 > 训练大模型太烧钱?Nous Research找到让AI"一目十行"的学习秘诀

训练大模型太烧钱?Nous Research找到让AI"一目十行"的学习秘诀

NousResearch团队提出“词元叠加训练”新方法,通过两阶段训练提升大语言模型效率:先合并词元进行粗粒度“扫读”,再恢复逐词预测进行“精读”。该方法使百亿参数模型训练提速2.5倍,且不改变模型结构或增加推理成本,其关键在于两阶段共享词汇表示空间以实现知识有效传递。


2026年5月7日,Nous Research团队在预印本平台arXiv上发布了一项引人注目的研究(编号arXiv:2605.06546),提出了一种名为“词元叠加训练”(Token Superposition Training, TST)的新方法。它试图解决一个困扰整个行业的核心难题:如何在不改变模型架构、不增加推理成本的前提下,显著提升大语言模型的训练效率。

想象一下,训练一个大模型,就像要求一个学生读完图书馆里所有的书。真正的瓶颈往往不是书不够,而是读书的速度太慢——传统方法要求模型逐字逐句地“精读”,每个词元(Token)都要单独处理。当全球的AI实验室都在为天价的算力账单焦头烂额时,Nous Research的思路显得颇为巧妙:何不让这个学生先学会“扫读”?快速浏览大量内容,建立起宏观的知识框架,然后再切换回精读模式,将粗略的印象深化为扎实的理解。实验结果显示,在训练一个百亿参数规模的模型时,TST方法实现了高达2.5倍的训练速度提升。

一、效率困境:给AI“加速”为何这么难?

要理解TST的价值,得先看清当前大模型训练面临的根本矛盾。业界普遍认同“规模定律”:模型参数越多、训练数据越海量,其能力通常越强。然而,这条定律的直接代价就是惊人的算力消耗,背后是数以万计的高端GPU和与之匹配的能源成本。

为此,研究者们探索了多种路径。有的在“原材料”上下功夫,比如设计更高效的分词器;有的在“加工流程”上做减法,例如稀疏混合专家模型(MoE),只激活部分参数以节省计算;还有的尝试“压缩表示”,让中间状态承载更多信息。但这些方法大多存在共同问题:它们要么改变了模型最终的结构,要么引入了额外的复杂性,可能在训练和推理之间造成“水土不服”。

Nous Research的出发点则截然不同。他们追问的是:能否找到一种方法,只在训练过程中“动动手脚”,一旦训练完成,得到的模型与常规模型别无二致,但训练过程本身却快得多?TST正是对这个问题的回答。

二、核心机制:先“扫读”,再“精读”

TST的工作原理,可以用一个上班族的阅读习惯来类比。他每天通勤时花20分钟快速浏览新闻头条,获取大量信息的轮廓;晚上再对感兴趣的文章进行深度阅读。因为有之前的背景知识打底,他的理解速度会快上不少。TST就模拟了这个过程。

具体操作分为两个泾渭分明的阶段:

第一阶段:叠加(扫读)
在这个阶段,训练数据中相邻的多个词元(例如5个)会被合并成一个“叠加词元”。合并方式极其简单:将这些词元对应的向量表示取平均值。于是,模型每一步计算能“看到”的原始文本量成倍增加。训练目标也随之调整,从预测下一个词,变为预测下一组词。为此,研究团队设计了“多热交叉熵损失”(MCE),要求模型平等地对待这组词中的每一个。

第二阶段:恢复(精读)
在叠加训练进行一段时间后,所有相关的代码被彻底移除,模型从保存的检查点开始,回归最传统的逐词预测训练。关键发现来了:经历过“扫读”预热的模型,在“精读”阶段的学习曲线下降得更快,仿佛已经对语言的整体分布有了预感,学习起来事半功倍。

这里有一个精妙的设计:为了确保对比的公平性,研究团队控制了每一步训练的计算量(FLOPs)完全相同。在叠加阶段,他们通过同比增加输入序列的长度来实现这一点。因此,效率的提升纯粹来自于算法创新,而非简单的计算堆砌。

三、效果拆解:输入与输出的协同

为了厘清TST效果的来源,研究团队进行了细致的拆解实验,分别测试了“输入叠加”(只对输入向量取平均)和“输出叠加”(只将预测目标改为词袋)。

结果表明,两者单独使用都能带来增益,但结合使用时效果最佳,且呈现出协同效应,而非简单相加。这暗示两种机制作用于不同层面:输入叠加改变了模型感知信息的“粒度”,让单位计算能消化更多数据;输出叠加则改变了学习的目标和梯度信号,引导模型建立不同的关联。

输出叠加的思路与以往的“多词元预测”(MTP)研究有相似之处,但TST的简洁性在于它不引入任何额外参数。而输入叠加——将几个词的向量取平均——则在现有文献中少有直接先例。为什么这种看似会丢失信息的操作反而有益?研究团队提出了两种猜想:一是这相当于一种“预预训练”,让模型先在粗粒度的语言分布上热身;二是取平均操作本身可能对词向量空间产生了一种隐性的正则化效果,迫使向量排列更加有序。

四、关键洞察:连续性的价值

一个自然的疑问是:结合粗粒度与细粒度学习的想法并不新鲜,为何TST能成功?研究团队指出,以往类似方法通常会在两个阶段之间引入一个“对齐”阶段,例如冻结主模型、只训练一个小型适配器,以防表示空间错位。

但他们的直觉是,正是这种“对齐”操作掩盖了粗粒度预训练的潜力。为了验证,他们设计了一个破坏性实验:在TST第一阶段结束后,随机重新初始化模型的输入嵌入层和输出层,然后开始第二阶段训练。结果,模型性能不仅倒退,甚至比完全没用TST的基线还要差。第一阶段的计算全部白费。

这个实验强有力地证明,TST有效的核心在于两个阶段共享了完全相同的词汇表示空间。词向量空间的连续性是两个阶段能够“对话”、知识得以传递的桥梁。一旦切断这个桥梁,整个机制便宣告失效。

五、数据说话:从实验到验证

任何方法的可信度最终都要靠实验数据支撑。研究团队在从2.7亿到100亿参数的不同规模模型上进行了系统验证。

对于中小型模型,他们进行了详尽的超参数扫描。结果显示,叠加大小在4到8之间,叠加训练步数占总步数的比例(比率r)在0.2到0.4之间时,效果最为稳定可靠。比率达到1.0(全程叠加)时,模型几乎无法产出合理文本。

在一个30亿参数模型的对比实验中,使用TST的模型在消耗相同总计算量的情况下,达到了更低的损失值。要达到相同的性能,基线模型需要多消耗约80%的计算量。在下游任务(如常识推理HellaSwag和科学知识测验ARC-Easy)上,TST模型的表现与消耗了更多算力的基线模型持平。

最具说服力的结果来自一个100亿总参数、10亿活跃参数的混合专家模型(MoE)。在达到相同损失值的前提下,TST版本所需的训练步数减少了约2.5倍。由于每一步计算量相等,这直接意味着2.5倍的训练时间节省。论文中的损失曲线图直观地展示了两条曲线在不同步数交汇于同一点,视觉冲击力强烈。

六、设计细节:损失函数与权重探索

在技术细节上,研究团队对多热交叉熵损失(MCE)进行了严谨的数学推导。其核心是让模型对目标词袋中的每个词分配均等的概率。他们证明,这种优化目标在数学上是合理的。

团队也探索了多种变体,例如不强制均匀分配概率,只要求词袋的总概率和为1;或者根据词距远近赋予不同权重(灵感来源于自然语言中互信息随距离衰减的幂律现象)。实验发现,对于较小的叠加大小,均匀权重效果最好;对于较大的叠加大小(如8以上),采用幂律衰减的权重方案能保持性能稳定。

七、定位对比:TST与同类方法有何不同?

最容易与TST混淆的是“多词元预测”(MTP)。两者关键区别在于:MTP需要为每个要预测的未来词引入独立的预测头,这会增加参数和推理开销,且其主要收益体现在加速推理生成上。而TST不增加任何参数,其收益完全体现在训练阶段,最终得到的模型与标准模型完全相同。

另一种类似思路是SuperBPE,它通过修改分词器来创建“超词元”,永久性地改变了模型的输入格式。TST则完全不同,其“叠加”完全发生在内部的向量表示层面,分词器和模型的对外接口没有任何改变。

八、局限与展望

研究团队也坦诚地指出了当前工作的边界。TST的核心前提是训练受算力约束而非数据约束。如果未来高质量数据成为更稀缺的资源,那么TST中“输入叠加”部分(因其消耗更多数据)的价值可能需要重新评估,尽管“输出叠加”部分仍可能有效。

此外,由于叠加阶段实际上处理了更长的原始文本上下文,TST理论上可能对提升模型的长文本理解能力有额外帮助,但这在本次研究中未得到评估。最优超参数(叠加大小、比率)目前也主要依靠经验总结,尚未建立起可预测的“规模律”模型。最后,所有实验均为单次运行,统计显著性有待更多重复实验验证。

总而言之,TST像是指点学生掌握了一种“先整体、后局部”的高效学习方法。它不换教材、不改大脑、不请家教,仅仅调整了学习的节奏,就实现了显著的效率提升。对于行业而言,这类研究如果经得起后续检验,将意味着同性能模型的训练成本有望降低,让更多参与者能够踏入大模型竞技场。当然,作为一项预印本研究,其结论仍需学术共同体进一步的评审与复现。

Q&A

Q1:训练完成后,TST会影响模型的使用方式吗?
A:完全不会。TST仅在训练阶段生效,相关代码在第二阶段开始时即被移除。最终产出的模型在结构、输入输出格式上与常规训练的模型毫无二致。

Q2:把多个词的向量取平均,不会导致信息混淆吗?
A:这恰恰是设计的一部分。在“扫读”阶段,模型确实会丢失词序等细节信息,但研究结果表明,这种粗粒度的、关于整体分布的学习,能为后续的精细学习提供有价值的“预热”。信息损失是一种有意的、可控的代价。

Q3:如果训练数据本身有限,TST还适用吗?
A:这是TST的一个局限。它假设算力是主要瓶颈。在数据受限的场景下,可以考虑仅采用“输出叠加”部分(即改变预测目标),而不使用会增加数据消耗的“输入叠加”。这种场景的深入探索被列为未来的研究方向。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。