训练大模型太烧钱?Nous Research找到让AI"一目十行"的学习秘诀
NousResearch团队提出“词元叠加训练”新方法,通过两阶段训练提升大语言模型效率:先合并词元进行粗粒度“扫读”,再恢复逐词预测进行“精读”。该方法使百亿参数模型训练提速2.5倍,且不改变模型结构或增加推理成本,其关键在于两阶段共享词汇表示空间以实现知识有效传递。

2026年5月7日,Nous Research团队在预印本平台arXiv上发布了一项引人注目的研究(编号arXiv:2605.06546),提出了一种名为“词元叠加训练”(Token Superposition Training, TST)的新方法。它试图解决一个困扰整个行业的核心难题:如何在不改变模型架构、不增加推理成本的前提下,显著提升大语言模型的训练效率。
想象一下,训练一个大模型,就像要求一个学生读完图书馆里所有的书。真正的瓶颈往往不是书不够,而是读书的速度太慢——传统方法要求模型逐字逐句地“精读”,每个词元(Token)都要单独处理。当全球的AI实验室都在为天价的算力账单焦头烂额时,Nous Research的思路显得颇为巧妙:何不让这个学生先学会“扫读”?快速浏览大量内容,建立起宏观的知识框架,然后再切换回精读模式,将粗略的印象深化为扎实的理解。实验结果显示,在训练一个百亿参数规模的模型时,TST方法实现了高达2.5倍的训练速度提升。
一、效率困境:给AI“加速”为何这么难?
要理解TST的价值,得先看清当前大模型训练面临的根本矛盾。业界普遍认同“规模定律”:模型参数越多、训练数据越海量,其能力通常越强。然而,这条定律的直接代价就是惊人的算力消耗,背后是数以万计的高端GPU和与之匹配的能源成本。
为此,研究者们探索了多种路径。有的在“原材料”上下功夫,比如设计更高效的分词器;有的在“加工流程”上做减法,例如稀疏混合专家模型(MoE),只激活部分参数以节省计算;还有的尝试“压缩表示”,让中间状态承载更多信息。但这些方法大多存在共同问题:它们要么改变了模型最终的结构,要么引入了额外的复杂性,可能在训练和推理之间造成“水土不服”。
Nous Research的出发点则截然不同。他们追问的是:能否找到一种方法,只在训练过程中“动动手脚”,一旦训练完成,得到的模型与常规模型别无二致,但训练过程本身却快得多?TST正是对这个问题的回答。
二、核心机制:先“扫读”,再“精读”
TST的工作原理,可以用一个上班族的阅读习惯来类比。他每天通勤时花20分钟快速浏览新闻头条,获取大量信息的轮廓;晚上再对感兴趣的文章进行深度阅读。因为有之前的背景知识打底,他的理解速度会快上不少。TST就模拟了这个过程。
具体操作分为两个泾渭分明的阶段:
第一阶段:叠加(扫读)
在这个阶段,训练数据中相邻的多个词元(例如5个)会被合并成一个“叠加词元”。合并方式极其简单:将这些词元对应的向量表示取平均值。于是,模型每一步计算能“看到”的原始文本量成倍增加。训练目标也随之调整,从预测下一个词,变为预测下一组词。为此,研究团队设计了“多热交叉熵损失”(MCE),要求模型平等地对待这组词中的每一个。
第二阶段:恢复(精读)
在叠加训练进行一段时间后,所有相关的代码被彻底移除,模型从保存的检查点开始,回归最传统的逐词预测训练。关键发现来了:经历过“扫读”预热的模型,在“精读”阶段的学习曲线下降得更快,仿佛已经对语言的整体分布有了预感,学习起来事半功倍。
这里有一个精妙的设计:为了确保对比的公平性,研究团队控制了每一步训练的计算量(FLOPs)完全相同。在叠加阶段,他们通过同比增加输入序列的长度来实现这一点。因此,效率的提升纯粹来自于算法创新,而非简单的计算堆砌。
三、效果拆解:输入与输出的协同
为了厘清TST效果的来源,研究团队进行了细致的拆解实验,分别测试了“输入叠加”(只对输入向量取平均)和“输出叠加”(只将预测目标改为词袋)。
结果表明,两者单独使用都能带来增益,但结合使用时效果最佳,且呈现出协同效应,而非简单相加。这暗示两种机制作用于不同层面:输入叠加改变了模型感知信息的“粒度”,让单位计算能消化更多数据;输出叠加则改变了学习的目标和梯度信号,引导模型建立不同的关联。
输出叠加的思路与以往的“多词元预测”(MTP)研究有相似之处,但TST的简洁性在于它不引入任何额外参数。而输入叠加——将几个词的向量取平均——则在现有文献中少有直接先例。为什么这种看似会丢失信息的操作反而有益?研究团队提出了两种猜想:一是这相当于一种“预预训练”,让模型先在粗粒度的语言分布上热身;二是取平均操作本身可能对词向量空间产生了一种隐性的正则化效果,迫使向量排列更加有序。
四、关键洞察:连续性的价值
一个自然的疑问是:结合粗粒度与细粒度学习的想法并不新鲜,为何TST能成功?研究团队指出,以往类似方法通常会在两个阶段之间引入一个“对齐”阶段,例如冻结主模型、只训练一个小型适配器,以防表示空间错位。
但他们的直觉是,正是这种“对齐”操作掩盖了粗粒度预训练的潜力。为了验证,他们设计了一个破坏性实验:在TST第一阶段结束后,随机重新初始化模型的输入嵌入层和输出层,然后开始第二阶段训练。结果,模型性能不仅倒退,甚至比完全没用TST的基线还要差。第一阶段的计算全部白费。
这个实验强有力地证明,TST有效的核心在于两个阶段共享了完全相同的词汇表示空间。词向量空间的连续性是两个阶段能够“对话”、知识得以传递的桥梁。一旦切断这个桥梁,整个机制便宣告失效。
五、数据说话:从实验到验证
任何方法的可信度最终都要靠实验数据支撑。研究团队在从2.7亿到100亿参数的不同规模模型上进行了系统验证。
对于中小型模型,他们进行了详尽的超参数扫描。结果显示,叠加大小在4到8之间,叠加训练步数占总步数的比例(比率r)在0.2到0.4之间时,效果最为稳定可靠。比率达到1.0(全程叠加)时,模型几乎无法产出合理文本。
在一个30亿参数模型的对比实验中,使用TST的模型在消耗相同总计算量的情况下,达到了更低的损失值。要达到相同的性能,基线模型需要多消耗约80%的计算量。在下游任务(如常识推理HellaSwag和科学知识测验ARC-Easy)上,TST模型的表现与消耗了更多算力的基线模型持平。
最具说服力的结果来自一个100亿总参数、10亿活跃参数的混合专家模型(MoE)。在达到相同损失值的前提下,TST版本所需的训练步数减少了约2.5倍。由于每一步计算量相等,这直接意味着2.5倍的训练时间节省。论文中的损失曲线图直观地展示了两条曲线在不同步数交汇于同一点,视觉冲击力强烈。
六、设计细节:损失函数与权重探索
在技术细节上,研究团队对多热交叉熵损失(MCE)进行了严谨的数学推导。其核心是让模型对目标词袋中的每个词分配均等的概率。他们证明,这种优化目标在数学上是合理的。
团队也探索了多种变体,例如不强制均匀分配概率,只要求词袋的总概率和为1;或者根据词距远近赋予不同权重(灵感来源于自然语言中互信息随距离衰减的幂律现象)。实验发现,对于较小的叠加大小,均匀权重效果最好;对于较大的叠加大小(如8以上),采用幂律衰减的权重方案能保持性能稳定。
七、定位对比:TST与同类方法有何不同?
最容易与TST混淆的是“多词元预测”(MTP)。两者关键区别在于:MTP需要为每个要预测的未来词引入独立的预测头,这会增加参数和推理开销,且其主要收益体现在加速推理生成上。而TST不增加任何参数,其收益完全体现在训练阶段,最终得到的模型与标准模型完全相同。
另一种类似思路是SuperBPE,它通过修改分词器来创建“超词元”,永久性地改变了模型的输入格式。TST则完全不同,其“叠加”完全发生在内部的向量表示层面,分词器和模型的对外接口没有任何改变。
八、局限与展望
研究团队也坦诚地指出了当前工作的边界。TST的核心前提是训练受算力约束而非数据约束。如果未来高质量数据成为更稀缺的资源,那么TST中“输入叠加”部分(因其消耗更多数据)的价值可能需要重新评估,尽管“输出叠加”部分仍可能有效。
此外,由于叠加阶段实际上处理了更长的原始文本上下文,TST理论上可能对提升模型的长文本理解能力有额外帮助,但这在本次研究中未得到评估。最优超参数(叠加大小、比率)目前也主要依靠经验总结,尚未建立起可预测的“规模律”模型。最后,所有实验均为单次运行,统计显著性有待更多重复实验验证。
总而言之,TST像是指点学生掌握了一种“先整体、后局部”的高效学习方法。它不换教材、不改大脑、不请家教,仅仅调整了学习的节奏,就实现了显著的效率提升。对于行业而言,这类研究如果经得起后续检验,将意味着同性能模型的训练成本有望降低,让更多参与者能够踏入大模型竞技场。当然,作为一项预印本研究,其结论仍需学术共同体进一步的评审与复现。
Q&A
Q1:训练完成后,TST会影响模型的使用方式吗?
A:完全不会。TST仅在训练阶段生效,相关代码在第二阶段开始时即被移除。最终产出的模型在结构、输入输出格式上与常规训练的模型毫无二致。
Q2:把多个词的向量取平均,不会导致信息混淆吗?
A:这恰恰是设计的一部分。在“扫读”阶段,模型确实会丢失词序等细节信息,但研究结果表明,这种粗粒度的、关于整体分布的学习,能为后续的精细学习提供有价值的“预热”。信息损失是一种有意的、可控的代价。
Q3:如果训练数据本身有限,TST还适用吗?
A:这是TST的一个局限。它假设算力是主要瓶颈。在数据受限的场景下,可以考虑仅采用“输出叠加”部分(即改变预测目标),而不使用会增加数据消耗的“输入叠加”。这种场景的深入探索被列为未来的研究方向。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















