发布于2026-08-20 阅读(0)
扫一扫,手机访问
先说一句:这项研究挺有意思。2026年6月,英国谢菲尔德大学计算机科学学院发表了一篇论文,编号arXiv:2606.28057v1,提出了一种叫MultiHashFormer的全新语言模型框架。它的核心思路,可以说是彻底重新设计了AI理解和生成文字的方式。感兴趣的读者可以通过论文编号在arXiv上找到完整原文。
你大概不知道,当你第一次打开一本厚厚的词典,会发现里面密密麻麻地列着几十万个词。现代AI语言模型在处理语言时,做的事情也差不多——它们维护着一张超级大的“词汇对照表”,把每一个词或词片段都映射到一长串数字上,这串数字就是AI真正理解和处理的东西。这张对照表,学术上叫“嵌入矩阵”。
问题出在哪儿呢?说白了,这张表里有多少词,AI就得腾出多大的存储空间来伺候它。举个常见的例子:一个英文AI模型可能有32000个词条,每个词条对应一个维度很高的数字向量。光是这张表,就可能占据模型总参数量的相当大一块。更要命的是,如果你今天训练的模型只认英文,哪天想让它也懂中文,就必须把中文词汇全部塞进这张表,模型的体积立刻膨胀。这就是研究团队所说的“词汇瓶颈”——模型的词典越大,模型越臃肿,而且一旦固定就很难灵活扩展。
过去有人想了个聪明的办法:用“哈希”(hashing)来压缩这张表。哈希,简单来说就是一种把任意输入转换成固定范围内某个数字的函数,类似于把全班同学按生日月份分成12组,不管班里有多少人,组的数量永远是12。这样,就算词汇表有几十万个词,也可以把它们压缩映射到少得多的“桶”(bucket)里,大大节省了空间。
然而,这里出现了一个致命的麻烦:多个词可能被分到同一个桶里,就像“猫”、“地图”和“物理”这三个意思完全不同的词,碰巧被同一个哈希函数分配到了第40号桶。这在AI领域叫做“碰撞”(collision)。对于只需要理解输入的模型(比如做文本分类的模型),碰撞是可以接受的,毕竟模型只需要从输入中提取信息,即使几个词共享了同一个数字表示,模型还是能大概猜出意思。但对于需要生成文字的模型,碰撞就是灾难:当模型输出第40号桶时,我们根本不知道它究竟想说的是“猫”、“地图”还是“物理”。这就好比你问餐厅服务员要一道菜,他只给你一个模糊的编号,没有说具体菜名,厨房做出来什么就是什么——这显然不行。
正是这个根本性的难题,让哈希技术此前只能用在“理解型”(编码器)模型上,始终无法用于“生成型”(解码器)模型。MultiHashFormer的核心贡献,就是找到了一种优雅的方式绕过这个难题。
谢菲尔德大学的研究团队提出了一个颇为巧妙的解决思路:与其用一个哈希函数把词映射到一个编号,不如同时用多个不同的哈希函数,把每个词映射到一组编号的组合,这个组合称为“多哈希签名”(multi-hash signature)。
以具体的例子来说,假设我们有三个相互独立的哈希函数。“猫”这个词经过这三个函数分别计算,得到的结果是[12, 40, 56],而“地图”这个词得到的结果是[99, 40, 3]。你会发现,这两个词在第二个哈希函数上确实都得到了40,发生了局部碰撞。但它们的第一个和第三个数字完全不同,所以整体签名[12, 40, 56]和[99, 40, 3]是截然不同的两个组合,不会混淆。
这就好比是一套组合密码锁。单一密码锁只有一位数字,可能有多把不同的钥匙恰好都是数字“4”,打开的是同一把锁,傻傻分不清楚。但如果锁有三位数字,碰巧三位都一模一样的可能性就极低了,更何况还可以增加到四位、五位。MultiHashFormer就是用这种组合编码的思路,确保词汇表中每一个词都有且仅有一个独一无二的“身份证”——多哈希签名。
从数学角度看,这种方法的容量极为惊人。以论文中的实际配置为例,如果使用四个独立哈希函数,每个函数有16000个桶,那么理论上可以表示的独特签名数量高达16000的四次方,大约是65千万亿个——比现有任何语言模型的词汇量都大了不知道多少个数量级。换句话说,哪怕人类把所有语言里所有词汇都塞进来,也完全不会碰撞。
当然,实践中为了保证每个词都有唯一签名,研究团队还设计了一个“迭代重哈希”机制。当一个新词的签名不幸与已有词汇重复时,系统会自动调整最后一个哈希函数的随机种子,直到找到一个没人用过的组合为止。这就像是图书馆在给每本书编图书编号,如果新书的编号已经被用了,就稍微调整一下编号规则,直到找到空缺。
拿到了多哈希签名之后,模型需要把这组数字编号转换成AI能够处理的连续数字向量(dense vector),这个过程由模型的“哈希编码器”(Hash Encoder)负责。
对于签名中的每一个哈希编号,系统都有一个独立的“嵌入矩阵”——你可以把它理解为一本小词典,每个桶编号对应一个特定的数字向量。“猫”这个词的签名是[12, 40, 56],于是系统分别从第一个小词典里查第12号,从第二个小词典里查第40号,从第三个小词典里查第56号,拿到三个数字向量。
但问题来了:不同词共享桶编号是不可避免的(比如“猫”和“地图”都在第二个哈希函数下得到了40)。这意味着从第二本小词典里查到的第40号向量,同时被“猫”和“地图”共享了。如何在合并这三个向量时,让模型知道到底更该信任哪个哈希函数的结果?
研究团队的解决方案是一个“门控组合嵌入”(Gated Compositional Embedding)机制。简单来说,对于每个词,系统不是简单地把三个向量平均相加,而是让模型自己学会动态地判断每个哈希函数的贡献权重。具体做法是,把每个哈希向量先经过一个小型神经网络压缩成一个标量分数,再通过归一化处理(softmax)得到三个权重,最后按权重加权求和,得到一个综合的向量表示。最后再经过一个线性变换,把这个综合向量投影到模型主干的工作空间里。
用一个更直觉的比喻来理解:三个哈希函数就像是三个来自不同专业背景的鉴定专家。鉴定一件古董时,三位专家各自给出意见,但每个场合下他们的权威性不同——鉴定陶瓷时更信陶瓷专家,鉴定书法时更信书法专家。这个门控机制,就是让模型自动学会在不同情况下给不同专家分配不同的发言权重。
经过哈希编码器处理后,每个词就变成了一个固定维度的数字向量,可以交给模型的核心部分——Transformer解码器——进行序列处理了。这部分和普通的大语言模型完全一样:Transformer逐词读入这些向量,通过注意力机制捕捉上下文关系,为每个位置输出一个“语境化的隐藏向量”(contextualized hidden state),代表模型对当前词在整段话中的理解。
生成文字是MultiHashFormer最有创意的部分,也是整个框架能够突破哈希碰撞难题的关键所在。研究团队设计了一个“哈希解码器”(Hash Decoder),它的工作方式叫做“级联预测”(Cascaded Predictor)。
当模型需要预测下一个词时,它拿到Transformer输出的隐藏向量,开始逐步预测目标词的多哈希签名。以四个哈希函数为例,模型首先预测第一个哈希编号,然后结合这个预测结果去预测第二个哈希编号,再结合前两个结果预测第三个,最后预测第四个。这四步是按顺序、逐步细化的,每一步的预测都会影响下一步的预测范围。
每一步的具体做法是:把当前的“哈希状态向量”(一开始就是Transformer输出的隐藏向量)乘以对应哈希函数的“输出权重矩阵”,得到一个在所有桶编号上的概率分布,即哪个桶编号最有可能是目标词在这一步的哈希结果。
在非最后一步时,为了让预测可以通过反向传播(即AI学习的核心机制)进行训练,系统不直接取概率最高的桶编号作为硬性决定,而是计算一个“软嵌入”——用每个桶的概率作为权重,对所有桶的向量做加权平均,得到一个连续的、可微分的综合向量。这个软嵌入代表模型当前对第一步哈希结果的“模糊猜测”。
然后,模型把原来的哈希状态向量和这个软嵌入拼接在一起,经过一个小型“级联混合器”(Cascade Mixer)网络处理,更新成新的哈希状态向量,再用这个更新后的向量去预测第二步的哈希编号。依此类推,直到预测完全部哈希编号,整个多哈希签名就完整地生成出来了。
这整个过程就像是一场侦探推理:侦探(模型)先根据现场证据(上下文)推断出凶手(目标词)身份的第一条线索(第一个哈希编号),再用这条线索缩小嫌疑人范围,进一步推断第二条线索,层层排查,最终锁定唯一的嫌疑人(完整的多哈希签名)。每一步推断都建立在前一步的基础上,形成一个层层约束、逐步精确的推理链条。
得到完整的多哈希签名之后,只需要查询事先建立好的签名-词汇对照表,就能确定性地还原出具体的词语,完全没有歧义。
MultiHashFormer在训练和实际使用(推理)时,处理概率的方式略有不同,这个细节值得单独解释一下,因为它保证了模型既能高效学习,又不会在生成文字时出错。
训练时,模型面对的是一个巨大的“虚拟词汇空间”,由所有可能的哈希签名组合构成。实际上人类词汇只占这个巨大空间的极小一部分,大量的签名组合对应的根本不是真实的词。训练时模型不限制自己只能预测真实词汇对应的签名组合,而是允许预测任何组合,并通过将各步哈希编号的概率相乘来计算整体概率。这种“解绑”的设计大大简化了优化过程,让模型能更高效地学习。
但推理时,如果模型生成了一个不对应任何真实词汇的签名组合,就彻底没有意义了。因此,推理时模型会明确排除所有无效签名,只在真实词汇对应的签名上进行概率归一化。具体做法是:对词汇表中的每个词,把其多哈希签名各步的预测概率相乘,得到这个词的原始得分,再对所有词的得分做归一化,得到最终的概率分布,取概率最高的词作为生成结果。
这就好比一场考试,训练时老师让你在草稿纸上随意演算,不限制格式,只要最终答案对就行;正式答卷时,则只能在规定格式的答题纸上作答,乱涂乱写不算数。
研究团队把MultiHashFormer在100M(1亿)、1B(10亿)和3B(30亿)参数三种规模下与普通Transformer语言模型进行了系统性对比,测试了包括语言建模、常识推理、阅读理解等共10项任务。所有模型都从头开始训练,使用英文高质量网页文本数据集FineWeb-Edu,遵循计算最优训练规律(Chinchilla scaling law),1B和3B规模的模型各训练了1000亿个词的数据量。
总体来看,在1B和3B参数规模下,MultiHashFormer配置H4B16K(4个哈希函数,每函数16384个桶)在10项测试中的9项均超过了普通Transformer基线。以LAMBADA任务为例,这是一个需要模型预测段落最后一个词的任务,考验模型对长距离语境依赖的捕捉能力。在1B规模下,普通模型的准确率是30.41%,MultiHashFormer H4B16K达到了35.34%,提升了将近5个百分点;在3B规模下,普通模型是28.64%,MultiHashFormer则达到37.26%,提升超过8个百分点。HellaSwag(测试模型是否能判断一段叙述的合理延续)上,MultiHashFormer同样稳定领先。
为了确保这种性能提升不只是因为MultiHashFormer用了更多的参数,研究团队还设计了一个额外的对照组:在普通Transformer基线上多加几层,让它的参数总量与MultiHashFormer相当。结果显示,在这个严格的参数匹配条件下,MultiHashFormer H3B10K和H4B16K依然在10项测试中的8项超过了对应的加深版普通模型,进一步验证了多哈希机制本身带来的实质性改进。
不过有一个值得关注的例外:在OBQA(开卷问答,考察常识性百科知识)这项任务上,桶数较少的配置反而表现更好。研究团队分析认为,这可能是因为OBQA的词汇分布非常不均衡,有大量罕见的专业词汇;桶数太多时,这些罕见词汇的嵌入空间过于分散,反而难以学好。相反,桶数较少时,罕见词汇被迫与更多词共享表示,这种“强迫共享”反而有利于泛化。这也提示未来在选择配置时,需要根据具体任务的特性做适当调整。
在100M这个较小参数规模下,MultiHashFormer的表现不如在更大规模上稳定,有时反而不如纯粹加深层数的普通模型。研究团队认为原因在于:模型太小时,隐藏维度的限制、网络深度的不足,都会制约MultiHashFormer充分发挥多哈希机制的优势。这说明MultiHashFormer是一种更适合中大规模模型的方案,在规模较大时优势越来越显著。
语言模型有一个长久以来的痛点:对罕见词汇的处理能力偏弱。一个普通词汇(比如“猫”)在训练数据里出现几百万次,模型能学到非常丰富、精准的语义表示;但一个生僻词(比如某个罕见的专业术语或不常见的网络用语)可能只出现几十次,模型对它的理解就相当粗浅了,词与词之间的语义相似度也难以准确捕捉。
研究团队用剑桥稀有词数据集Card-660对1B参数规模的模型进行了专项测试。这个数据集包含了大量罕见词对(比如“retweeting”和“RTing”,“sci-fi”和“science-fiction”,“shit”和“shxt”等),并标注了人类对每对词语相似度的判断。测试方法是:让模型处理这两个词,拿到模型内部的隐藏向量,计算两个词对应向量的余弦相似度(两个向量方向越接近,相似度越高),再与人类标注的相似度对比。
结果显示,MultiHashFormer的两种配置(H3B10K和H4B16K)在皮尔逊相关系数和斯皮尔曼相关系数这两个统计指标上均优于同等参数规模的普通模型。尤其是倒数第二层(而非最后一层)的隐藏向量最能体现这一优势,因为最后一层受到具体训练任务的影响更大,倒数第二层的向量更纯粹地反映了模型对词义的理解。
为什么多哈希机制有助于稀有词汇的表示?关键在于“强迫共享”的机制。在普通模型里,每个词有一个完全独立的嵌入向量,一个罕见词出现次数少,它的嵌入向量就没有足够的训练机会变得准确。而在MultiHashFormer里,稀有词的多哈希签名中的每个桶编号,都与其他很多词(包括常见词)共享。这意味着,即使某个稀有词本身出现次数不多,它所在的每个桶的嵌入向量都被大量其他词汇“磨”得很精准。这种“借光”效应,使得稀有词的表示受益于高频词汇的大量训练信号,语义相似的词(比如缩写词与其完整形式)往往共享更多的桶编号,从而在嵌入空间中更加接近。
MultiHashFormer另一个令人印象深刻的特性,是它在扩展词汇时完全不需要增加模型参数。研究团队设计了一个多语言扩展实验来验证这一点。
他们先把在英文上预训练好的1B和3B参数模型,用阿拉伯语、中文、印地语(每种语言2B词)和额外的2B英文词进行持续训练(continual pre-training),同时向词汇表中每种语言各增加5000个新词,使词汇总量从32000扩展到48000。
对于普通Transformer基线,新增词汇意味着嵌入矩阵和输出层权重矩阵都要增加新行,1B规模的模型需要额外增加约3100万个参数来容纳15000个新词,新词的初始嵌入向量用原词汇表中对应来源词的平均向量初始化。
对于MultiHashFormer,情况则完全不同:新词只需要计算出它们的多哈希签名,登记到签名-词汇对照表里,其余什么都不用改。哈希桶的嵌入矩阵保持不变,门控权重保持不变,Transformer主干保持不变,解码器也保持不变。参数量零增加,模型结构零变化。
实验结果显示,在22项多语言测试任务中,1B规模的MultiHashFormer H4B16K在12项上优于普通Transformer基线,3B规模的则在13项上领先。特别值得注意的是,MultiHashFormer在英文任务上也没有明显退步(这种现象叫做“灾难性遗忘”),说明多语言持续训练并没有破坏模型原有的英文能力。
H3B10K和H4B16K两种配置在多语言任务上的表现差异不到1%,说明词汇扩展对MultiHashFormer的性能影响非常稳健,不依赖于某一特定的参数配置。
研究团队还系统测试了不同哈希函数数量(H)和桶大小(B)组合对模型性能的影响,实验均在1B参数规模下进行,训练200亿词数据。
首先是多哈希必要性的验证。研究团队分别测试了使用单个哈希函数(H=1)和使用四个哈希函数(H=4)的模型,在桶大小为4K、8K和16K三种配置下对比LAMBADA任务准确率。结果非常鲜明:单哈希函数在桶大小4K时只能达到4.29%的准确率,即便把桶扩大到16K也只有14.30%;而四个哈希函数在桶大小4K时就已经达到30.27%,16K时达到30.91%。多哈希在最小桶配置下的性能提升幅度高达约26个百分点,远远超过单纯增大桶数的效果。这清楚地说明:多哈希签名消除碰撞的作用,是整个框架性能的根本保障,光靠增大单个哈希函数的桶数无法替代。
其次,在固定使用四个哈希函数的条件下,研究团队测试了从H3B4K到H4B32K共八种不同配置的性能与参数量权衡。结果显示,几乎所有多哈希配置在语言建模和常识推理任务上都稳定超过普通Transformer基线,包括嵌入参数量远少于基线的配置(如H3B4K、H4B4K、H3B8K)。随着H和B的增大,嵌入参数量从约10M急剧增长到约102M,但性能提升却相对平缓,最优配置与最差配置之间的平均得分差距仅约4%。因此,H4B16K被确定为最优的平衡点,以可接受的参数量获得了最佳的整体性能,并被用于1B和3B规模的主实验。
研究团队还测试了一种叫做“局部敏感哈希”(LSH)的特殊哈希函数。LSH和普通哈希函数不同,它的设计目标是让相似的输入(比如拼写接近的词)映射到相同的桶——这原本被认为可能是有益的,因为形近词(如“retweeting”和“RT”)往往语义相近。然而实验结果表明,在MultiHashFormer中增加LSH函数的比例,并不能持续提升LAMBADA任务的准确率,没有明显规律可循。研究团队的解读是:模型完全有能力从普通随机哈希函数提供的自由度中,端到端地学习出词形相似性,不需要额外引入LSH的形态学偏置,而且LSH的计算复杂度比普通哈希函数高,综合性价比不如普通哈希。
研究论文的附录中有一段技术性较强但相当重要的理论分析,解释了MultiHashFormer为何在LAMBADA和HellaSwag这类高难度任务上表现特别突出。核心概念是“softmax瓶颈”(Softmax Bottleneck)。
softmax瓶颈是2018年由研究人员提出的一个理论问题。简单来说,语言模型在预测下一个词时,需要计算所有词的概率,最终用一个叫做softmax的操作把分数转换成概率。这个过程可以用矩阵的“秩”(rank)来衡量其表达能力——秩越高,模型能区分的词汇分布模式越丰富。普通Transformer语言模型的softmax输出的秩,被严格限制在隐藏维度d以内。如果真实语言分布需要比d更高的秩才能准确表达,模型就永远无法完美拟合,这就是瓶颈所在。
MultiHashFormer通过多个哈希函数的级联预测,将输出分布的秩上界提升到了min(B, H×d),远高于普通模型的d。这意味着MultiHashFormer在理论上具有更强的分布表达能力,能够区分更多微妙的词汇选择差异。在LAMBADA这种需要精准预测特定词的任务上,或者在HellaSwag这种需要区分叙述是否逻辑连贯的任务上,这种更强的表达能力就体现为实质性的性能优势。
这个理论分析与实验结果高度吻合:MultiHashFormer在这两项任务上的提升幅度最为明显,而在考察单纯常识知识记忆的OBQA上提升相对有限(甚至某些配置下略逊一筹),恰恰与理论预期一致。
说到底,MultiHashFormer做的事情可以用一句话概括:它把“词典”这个固定的枷锁换成了“密码组合”,让语言模型不再受词汇表大小的束缚,同时还能更准确地生成语言、理解稀有词汇、无缝扩展到新语言。
这项研究的意义不仅在于当下的性能提升,更在于它打开了一扇门。未来的语言模型如果采用类似思路,理论上可以在不增加模型体积的情况下,自由地吸收新的词汇、新的语言、新的领域知识——这对于需要跨语言、跨领域灵活应用的AI系统来说,无疑是一个非常吸引人的方向。当然,研究团队也坦诚地指出了当前工作的局限:受计算资源限制,最大只测试到了30亿参数,更大规模(比如70亿参数以上)的效果尚待验证;所有实验只跑了单次随机种子,缺乏统计重复性验证。这些都是未来值得进一步探索的方向。
归根结底,这项来自谢菲尔德大学的研究提供了一种颇具潜力的思路:通过重新设计词汇与模型之间的接口,可以同时实现更好的性能、更低的参数开销和更强的灵活性。对于任何关心AI语言技术未来走向的人,这都是一项值得关注的工作。有兴趣深入了解技术细节的读者,可以通过编号arXiv:2606.28057在arXiv平台查阅完整论文,研究代码也已在GitHub上开源发布。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9