当前位置:

首页 > 硬件相关 > AI的一大重要瓶颈,被一家初创公司解决了

AI的一大重要瓶颈,被一家初创公司解决了

Air Explorer Pro
Air Explorer Pro

Air Explorer Pro是一款跨平台多网盘管理工具,可实现一站式完成不同网盘间文件的互传、搜索和同步等操作。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

立即下载
¥99
Windows/macOS 2026-08-17
正版软件 Windows macOS软件 Pro 文件搜索工具 Pro下载 Pro正版软件 Pro购买

Transformer架构因注意力计算量随文本长度平方级增长,导致长上下文处理困难。初创公司Subquadratic提出SubQ模型,采用SSA动态稀疏注意力,将计算量降至O(nlogn)。在600万至1200万Token测试中准确率达98%,成本仅为同类模型的数百分之一。

主流大语言模型有个通病:文本一长,它们就犯迷糊。上下文太长,记忆就开始混乱,不是答非所问,就是反应迟钝,甚至干脆罢工。问题的根源,出在Transformer架构本身的数学瓶颈上——计算量随文本长度呈平方级增长。换句话说,文本长度翻倍,算力需求就得翻四倍;长度翻三倍,算力需求就得翻九倍。一旦文本量达到百万级Token(大约相当于两三部《三体》),计算量直奔万亿次,再强的GPU也扛不住。

这就是为什么大多数商用模型的上下文窗口都卡在128K到200K Token之间。这个数字听起来不小,但真到了要分析一整年的客服工单、处理装着几百个文件的代码仓库,或是审阅一份300页的并购协议时,模型就算不动了。

不过,最近一家名为Subquadratic的初创公司声称,他们把这个瓶颈打破了。

那么,这个瓶颈到底是怎么来的?

AI在阅读一段文本时,必须把每一个词(Token)和文本里所有的其他词逐一比对,计算它们之间的关联。如果有n个词,大概就要算n²次——这就是二次方的增长。处理100万个词,就需要计算大约100万×100万=1万亿个词与词之间的关系。即便用上最先进的GPU,单次推理也要花上几分钟,成本高达几十甚至上百美元。如果扩展到1200万个词,那就是144万亿次计算,经济上已经完全不现实了。而Subquadratic推出的SubQ模型,正是要大幅削减这个计算量。

AI如何读懂一句话?

先看一个最简单的句子:“动物没过马路,因为它很害怕。”人一眼就能看懂,“它”指的当然是“动物”,而不是“马路”。但一个既没有眼睛也没有常识的AI,是怎么理解的呢?

第一步,AI得把文字变成数字。每个大语言模型内部都有一本巨大的词典,每个词(Token)对应一排固定长度的数字。比如,动物 = [0.8, 0.1, 0.3, 0.9],马路 = [0.1, 0.9, 0.2, 0.3],它 = [0.6, 0.4, 0.8, 0.5]。这一排数字叫向量,每个维度代表一种特性,相当于这个词在数学空间里的经纬度坐标。“动物”和“马路”在“是否有生命”这个维度上的数值差距很大(0.8 vs 0.1),机器一看就知道它们不是同类。

光有词向量还不够。在“狗咬人”和“人咬狗”这两句话里,“狗”和“人”各自的向量并没有变,模型分不清谁是施动者、谁是被动者。所以,必须给每个词贴上一个“座位号”,这叫位置编码。此后,每个词就变成了一个携带自身坐标和位置的数字包裹,列队进入模型真正的核心区域——Transformer(转换器)。

接下来的一步,是所有语言理解的起点:把离散的符号,变成连续的数学对象。Transformer要给每个词造三张身份牌,分别叫Q(Query,查询)、K(Key,键)和V(Value,值)。

  • Q 代表“我在找什么?”
  • K 代表“我是什么?”
  • V 代表“我带了什么具体信息?”

造牌的方法很简单:词向量分别乘以三个不同的矩阵。这三个矩阵是模型在训练阶段自己学出来的,对每个词都一样。拿“动物”来说:Q可能是[1.0, 0.0, 1.0, 0.0](我在找一个能做动作的主语),K可能是[0.9, 0.1, 0.8, 0.2](我是有生命、能移动的实体),V可能是[0.2, 0.7, 0.5, 0.1](我身上的具体信息是“四条腿、毛茸茸”)。三者的用途截然不同:Q是拿出去提问的,K是供其他词匹配的,V是等着被提取的。同样,“它”也会生成自己的Q——[1.0, 0.0, 1.0, 0.0],它也在找“有生命的主语”。

现在,“它”拿着自己的Q,要去和句子中所有其他词的K做一次关系测试。这个测试在数学上就是两个向量的点积。先跟“动物”的K做测试:1.0×0.9 + 0.0×0.1 + 1.0×0.8 + 0.0×0.2 = 1.7。再跟“马路”的K做测试:1.0×0.1 + 0.0×0.8 + 1.0×0.1 + 0.0×0.9 = 0.2。1.7比0.2大得多——“它”跟“动物”之间的亲密度,远超跟“马路”的。

随后,利用Softmax函数,将各个点积转化为归一化的权重,也就是注意力权重。对于“它”这个词来说,“动物”占据大约68%的权重,“马路”只占32%。最后,把所有词的V按这个权重混合,生成一个全新的向量Z它 = 动物的V×68% + 马路的V×32%,得到[0.424, 0.508, 0.436, 0.324]。至此,“它”从一个没有上下文的空壳代词,变成了指向明确实体的词。在最终的Z它中,68%是动物的信息,32%是马路的信息。

以上操作被称为注意力层,本质上就是一次加权平均。但这种操作是线性的,光靠它,模型还学不会复杂的逻辑。因此,在每一层的“加权平均”之后,紧跟着还要加上一个前馈网络(FFN)。FFN的结构很简单:对Z先后施加两次线性变换,第一次大幅升维,第二次降回原维度,中间夹一个用来清零无关特性的筛选函数。这一步能提炼出更高层次的抽象特征,并从海量参数中检索出与当前上下文最相关的事实信息。注意力层让“它”指向“动物”,FFN则在这个基础上进行统计学联想,把“动物”“害怕”和“不过马路”匹配起来。

这只是第一层。在真实的Transformer架构中,通常有几十层这样的结构——GPT-4就有120层以上。每一层都在处理不同级别的抽象信息:浅层关注词性和语法,中层关注指代关系和语义角色,深层关注逻辑推理和情感。每一层的输出都是下一层的输入,每一层都在改写每个词的向量。第一层让“它”知道自己是“动物”,第二层让“动物”知道自己是“害怕”的主体,到了第30层,“动物”这个向量里已经浓缩了整句话的因果逻辑。

几十层简单操作的反复迭代和逐级抽象,这就是AI模型理解文本的秘密。

SubQ有何优化?

理解了Transformer的完整原理,也就明白了SubQ到底在优化什么。

在Transformer每一层的注意力层中,每个词的Q都要跟所有词的K算一遍点积,这叫密集注意力,是目前的主流做法。举个例子,AI要总结《红楼梦》,就必须同时看到从第一个词到最后一个词的全部词语,并把它们两两组合起来——不管这些组合有没有意义。假设在圆周上点出n个点,每个点代表一个词,然后在每两个点之间连一条线,代表一对组合。最终线条的条数是n(n-1)/2,简化后就是O(n²)。

而SubQ则把这个数目压缩到O(n log n)或O(n·k)(k是一个很小的常数)。如果n极大,削减量就相当可观。100万个词原本需要大约10¹²次运算,SubQ把这个数字压低大约64倍——这就是“算得动”和“算不动”之间的差别。到了1200万个词,差距就更大了:原方法的成本会变成天文数字,而SubQ的花费仍然在可承受范围内。

SubQ的办法是稀疏注意力——跳过那些不重要的组合,只算关键的组合。回到“动物没过马路,因为它很害怕”这个句子,人凭直觉就能判断“它”指代的是“动物”,根本不会去算“它”和“马路”的关系,更不会去琢磨“很”和“马路”之间有什么关联。问题在于:AI如何判断哪些关系重要,哪些不重要?

以前那些稀疏注意力的方法,大多依赖于固定模式。比如,每个词只跟它左右512个邻居计算点积,或者每隔一段固定距离再选一个词计算。这些方法确实压缩了计算量,但也让模型变成了近视眼——如果关键信息刚好隔了600个词,肯定就遗漏了。

SubQ模型的SSA架构所做的,就是在注意力层这一步引入了一个经过训练的智能筛选器。Subquadratic声称,他们的SubQ模型第一次实现了真正的动态选择性稀疏注意力:不靠固定规则,而是让模型自己学会判断——在当前这段文本里,哪些词与词之间的关系真的有用,然后只算这些组合之间的点积。关系模式随文本内容动态变化,每一段文本的关注清单都不一样。

检验与争议

Subquadratic上个月刚刚走出隐身模式,就发布了这个消息,很多人表示怀疑。一个月后,公司请了第三方评估机构来做独立测试。结果相当亮眼:在LiveCodeBench(编程能力测试)中,SubQ得分89.7%,跟OpenAI、Anthropic、Google DeepMind的顶级编程模型处于同一梯队。在大海捞针测试(长上下文检索)中,面对600万和1200万Token的上下文,SubQ达到了98%的准确率,属于近乎完美的顶尖水平。速度测试显示,SubQ比一种更早的稀疏注意力模型快了56倍。成本方面,在RULER 128测试中,Anthropic的Opus 4.6运行一遍的成本是2600美元,而SubQ只花了8美元。

独立测试的高分表现证明了SubQ的能力,但争议也随之而来。最关键的质疑点在于:SubQ并非从头开始训练,而是复用了中国开源模型Qwen已经训练好的模型参数,因此并不能完全证明SSA架构的优越性。一些研究人员认为,目前的公开证据还不足以说明SubQ已经彻底解决了长文本处理的瓶颈。此外,SubQ至今没有大规模开放试用,也让很多人持观望态度。

又一次变革?

目前,处理长文档的主流方案是RAG(检索增强生成)——把文档切成小块,先搜索相关内容块,再送给模型生成答案。但RAG有两个固有缺陷:第一,检索环节可能漏掉关键信息;第二,跨文档的复杂逻辑会被切碎。如果SubQ真的能以极经济的成本处理百万甚至千万级Token的上下文,情况将大为不同:模型可以直接吞下整份文档或整个代码库,无需任何中介替它筛选。

在跨文档分析方面,一次演示中,SubQ分析了400份文档里的信息,只需几秒就能做出回应,而Perplexity连400份文档都没能全部加载。

Subquadratic明确表示,公司正在逐步扩大访问范围,接下来的目标是继续优化SSA架构,并计划发布更多经过第三方验证的测试结果。他们踌躇满志,希望用SSA架构改变大语言模型的构建方式。“我们想开启一个新时代,”该公司联合创始人兼CEO Justin Dangel说,“我们认为,几年之后,谁也不会再用标准Transformer来建模型了。”

这话听上去很狂。但回想2017年,那篇题为《Attention Is All You Need》的论文刚发表时,很多人也觉得,抛弃AI的正统循环神经网络、代之以注意力机制,是个非常疯狂的想法。那时还没什么名气的OpenAI率先注意到了Transformer的潜力,五年后,ChatGPT横空出世,从此Transformer成了构建AI的主流方式。

变革会不会重演,取决于SubQ接下来的表现。此外,像OpenAI和Google这样的巨头是不是已经找到了同样的答案,只是秘而不宣?让我们拭目以待。

参考文献

https://www.technologyreview.com/2026/06/19/1139313/a-startup-claims-it-broke-through-a-bottleneck-thats-holding-back-llms/
https://www.mindstudio.ai/blog/what-is-sub-quadratic-sparse-attention-subq-ssa

本文内容来源于网友投稿,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

打印机加墨水后打印不出颜色的原因及解决方法
打印机加墨水后打印不出颜色的原因及解决方法

解决打印机加墨水后打印无色的问题,涵盖墨盒芯片计数器重置、喷头气锁排除方法以及驱动程序颜色设置检查,帮助用户快速恢复彩色打印功能。

显示器无信号但主机正常工作原因排查与解决方法
显示器无信号但主机正常工作原因排查与解决方法

面对主机运转正常但显示器无信号的困境,本文通过场景化分析,指导用户从线缆检查、输入源切换、内存金手指清洁到显卡重新插拔,逐步排除故障,恢复显示。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

即将离开本站
您即将前往第三方网站,请确认是否继续?