当前位置:

首页 > 硬件相关 > 内存通胀“终结者”?谷歌公开最新极限压缩算法

内存通胀“终结者”?谷歌公开最新极限压缩算法

要破解大模型面临的算力难题,降低其训练和运行时所需的存储与计算空间,路径其实不少。关键是要理清:痛点究竟是在训练环节,还是在推理环节?市面上主流的稀疏化、量化、模型压缩与知识蒸馏等技术,各有侧重,而不同的研究机构和模型厂商,也基于自身的技术栈和场景需求,选择了不同的突破方向。 就拿让许多模型头疼的长

要破解大模型面临的算力难题,降低其训练和运行时所需的存储与计算空间,路径其实不少。关键是要理清:痛点究竟是在训练环节,还是在推理环节?市面上主流的稀疏化、量化、模型压缩与知识蒸馏等技术,各有侧重,而不同的研究机构和模型厂商,也基于自身的技术栈和场景需求,选择了不同的突破方向。

就拿让许多模型头疼的长上下文任务来说吧。过去两年,业内算法团队的一个主流思路,是围绕“键值缓存”做文章,提出了分离式架构设计——也就是根据预填充和解码的不同计算特性,将它们分别部署到不同的服务器上。但这种方案在应对大批次处理和排队场景时,对系统内存带宽提出了更高要求。说白了,对于很多推理任务而言,真正的瓶颈往往不在于算得快不快,而在于数据从内存里“搬”得够不够快。

今天,谷歌推出了一项名为TurboQuant的新算法,瞄准的正是这个核心痛点:大模型运行时恐怖的内存消耗。它的目标很明确,就是让AI在“思考”和“回答”时,占用少得多的工作内存,同时还能保持几乎等价的智力水平,甚至反应更快。

这项技术的潜在影响是显而易见的。在模型推理侧,处理百万级Token上下文的成本有望显著下降;对于向量数据库,实时索引和亚毫秒级查询将更容易实现;而在边缘AI领域,手机和嵌入式设备运行长上下文推理也不再是遥不可及的幻想。此外,这一思路完全可以延伸到多模态领域,用于向量数据的压缩。

市场总是最敏锐的。就在这项技术发布的当天,美股存储板块,包括美光科技、闪迪等公司的股价应声下跌。近几年,受全球数据中心建设热潮的推动,内存、固态硬盘等存储产品一度供应紧张、价格高企。市场的这一反应不难理解:一旦TurboQuant这类技术得到广泛应用,未来AI推理服务器对内存容量规格的需求预期将被重塑,整个硬件成本曲线可能因此改变。

要真正理解TurboQuant的价值,得先弄明白大模型生成文本的基本原理。它们并非一下子吐出整段话,而是像我们人类边想边说,一个字一个字地往外“蹦”。在这个过程中,模型需要一个“临时记事本”,用来记住之前所有对话或文本的内容,避免对相同信息反复计算。这个技术上的“记事本”,就是键值缓存。麻烦在于,对话越长,“记事本”就越厚,对昂贵的高性能内存的占用也就越惊人。在处理超长文档或复杂多轮对话时,KV Cache会迅速成为拖慢AI速度、推高运行成本的主要瓶颈。

TurboQuant的破解之道,在于两个精巧的算法组合:负责主压缩的PolarQuant,和负责精细校正的QJL,双管齐下,目标直指压缩KV Cache中的高维向量。

第一步:PolarQuant——高质量压缩

传统的量化方法,好比用“东南西北”的直角坐标来记录一个点的位置。而TurboQuant的第一步PolarQuant,则换了一种思路,改用“角度和距离”的极坐标来描述。研究发现,经过一种特定的数学变换后,高维向量的数值分布会变得非常规整,就像一个刻好固定刻度的圆形标尺。这样一来,系统就能提前准备一套最优的压缩“密码本”,无需每次对话都临时校准,实现了真正的在线实时压缩。这一步,用大部分的比特位完成了对数据主体的高质量“瘦身”。

第二步:QJL——消除隐藏误差

主压缩之后,总会残留一些微小的误差。如果置之不理,当AI计算“注意力”(即判断该关注对话中的哪部分内容)时,这些误差会不断累积,最终导致“关注点”出现偏差。TurboQuant的第二个创新点,就是用名为QJL的方法来处理这些残差。QJL的聪明之处在于,它仅用1个比特来标记残差的方向,然后与高精度的原始查询向量结合,最终能实现无偏差的内积估算。这意味着,数据虽然被大幅压缩了,但AI在判断“信息重要性”时,得出的结论依然精准可靠。

根据谷歌官方博客披露的数据,TurboQuant带来了接近理论极限的性能提升:

极致压缩:能将KV Cache压缩到每通道仅3比特,与传统16或32比特存储相比,内存占用减少至少6倍。在长上下文测试中,即便经过如此极致的压缩,模型仍然能精准找到隐藏信息,表现满分。
精度无损:在多个标准长上下文基准测试上,使用3.5比特配置的TurboQuant,模型性能与使用全精度缓存时完全一致;即便是2.5比特配置,性能也只有轻微下降。
速度飞跃:由于需要从内存中读取的数据量锐减,计算速度获得极大提升。在H100 GPU上,4比特TurboQuant处理注意力核心步骤的速度,比未压缩的32比特版本快了整整8倍。

总而言之,TurboQuant能够以极低的内存占用、近乎零的预处理时间,构建并查询高精度的大型向量索引。这使得谷歌规模的语义搜索变得更快、更高效。当然,这项技术的意义绝不仅仅是实验室里的突破。据博客透露,虽然TurboQuant目前主要解决的是Gemini等模型的KV Cache瓶颈,但其底层技术同样适用于任何需要在高维向量数据库中进行海量搜索的场景,比如现代的语义搜索引擎。

该技术的相关论文已被接收,将于ICLR 2026和AISTATS 2026学术会议上正式发表。

相关链接:https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
相关论文链接:https://arxiv.org/pdf/2502.02617

(本文作者 | 杨丽,编辑 | 杨林)

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。