当前位置:

首页 > 硬件相关 > 马里兰大学等:让AI自己设计AI的"思考策略",推理效率提升近70%

马里兰大学等:让AI自己设计AI的"思考策略",推理效率提升近70%

马里兰大学等机构提出AutoTTS框架,让AI自主设计推理策略以优化“测试时扩展”。该框架通过离线回放环境、单参数化约束等设计,仅用少量成本自动搜索出高效策略。实验表明,新策略在多项任务中能以更低计算量获得更高准确率,其复杂机制超出人工设计范畴,展现了AI自我改进的潜力。


一项关于如何让AI“思考”得更聪明的研究,近期在学术圈引起了广泛关注。这项由马里兰大学、弗吉尼亚大学、华盛顿大学圣路易斯分校、北卡罗来纳大学、谷歌和Meta等多家机构联合完成的工作,已于2026年5月8日以预印本形式发布在arXiv平台,论文编号为arXiv:2605.08083。

想象一下,当你向朋友请教一道难题时,他有两种帮法:一是直接告诉你答案,二是自己先琢磨几遍,综合多个思路再给你一个更稳妥的答复。大型语言模型(也就是那些能写文章、解数学题的AI)面临的情况也类似。研究人员很早就发现,如果允许AI在解题时“多花点时间思考”——比如让它生成多个不同的推理过程,再从中挑选最优解——其表现会有显著提升。这种在“回答问题时投入额外计算资源”的技术,专业上称为“测试时扩展”。

但问题在于,如何分配这些额外的计算资源,长期以来一直依赖人工经验。研究人员需要手动规定:何时开辟新思路、何时砍掉无效路径、何时该停止并给出答案。这就像厨师凭感觉调味,配方因人而异,且难以解释其内在逻辑。而这项研究的核心突破,在于提出了一个名为AutoTTS的框架,让AI能够自主发现最高效的“思考策略”,从而摆脱对人类直觉设计的依赖。

一、为什么AI的“思考方式”值得专门研究

要理解这项研究的意义,不妨用一个备考的比喻来切入。

高考前,学生拥有固定的备考时间。他可以选择将所有时间押在一门学科上,也可以均匀分配,或是根据自身薄弱环节灵活调整。不同的时间分配策略,最终成绩往往天差地别。AI在回答问题时面临类似的抉择:它拥有一定的“计算预算”,可以选择同时探索多条推理路径,也可以让某条路径思考得更深入,或在过程中评估当前进展是否值得继续。

现有的方法大多基于研究人员的“经验设计”。例如,“自我一致性”方法会让AI同时生成64条推理路径,然后通过投票选出最普遍的答案——这好比让64个学生独立解题,再统计哪个答案出现次数最多。还有一些更复杂的方法,例如根据答案的稳定程度决定何时停止生成新路径,或在推理中途“剪除”看似偏离正轨的路径。

研究团队梳理这些方法后发现,它们都可以被视作在一个“宽度-深度”平面上移动的不同轨迹。宽度代表同时探索的路径数量,深度代表每条路径的延伸长度。64路自我一致性就是宽度拉满、深度固定的一个点;有些方法只调整宽度;有些只增加深度;还有些会先拓宽、再剪枝、最后深化。将这些方法置于同一张图中,它们就像棋盘上走出的不同路线。

这一视角揭示了一个关键洞察:这些人工设计的方法都只是“特殊案例”,其背后存在一个更广阔、尚未被充分探索的策略空间。既然大家都在同一个空间里探索,何不让AI自己去找出最优路线呢?

二、AutoTTS框架:让AI来设计AI的思考策略

AutoTTS的核心思路可以概括为“建造游乐场,而非亲手玩游戏”。

过去,研究人员直接设计一套思考规则交给AI使用。AutoTTS改变了这一分工:研究人员负责搭建一个“环境”——定义AI可以执行的动作、环境的状态以及何为好的结果——然后让另一个AI(探索者)在这个环境中自动寻找有效策略。

这一框架在设计上包含几个至关重要的技术决策,每一个都旨在解决实际的工程难题。

首先是构建“离线回放环境”。评估一个思考策略的好坏,通常需要实际运行AI来生成推理过程,这既耗时又昂贵。AutoTTS的解决方案是预先收集所有可能用到的推理数据:针对每道题目,提前让AI生成128条完整的推理路径,并每隔500个词元(token,可理解为AI处理的最小文字单位)记录一次当前的答案状态。建立这个数据库后,评估任何策略都无需再次调用AI——只需在已存储的数据上“回放”即可,就像通过比赛录像研究战术,而无需每次都重赛一场。这使得评估成本几乎可以忽略不计。

其次是“单参数化”(论文中称为beta参数化)。在早期试验中,探索者AI倾向于设计包含十几个可调参数的复杂策略。参数越多,搜索空间就越大,在有限的搜索轮次内极易导致过拟合——即找到的策略仅在用于搜索的那批题目上表现良好,换一批题目便失效。为解决此问题,研究团队强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数,且随着β增大,策略必须系统性地“更愿意投入计算资源”。这好比规定厨师只能用“辣度”一个旋钮来调整整道菜的风味,而非自由调节盐、糖、醋、辣椒的各自用量。这一约束极大地简化了搜索难度,并使发现的策略更加稳健。

第三个关键设计是“执行轨迹反馈”。仅仅告知探索者AI“该策略准确率为X%,消耗了Y个词元”,信息量远远不够——就像只告诉厨师“这道菜不好吃”,却不指出问题所在。为此,系统会记录每个策略在每道题目上的完整决策过程:何时开辟新路径、何时剪除某条路径、何时选择继续深化。这些细节被完整地反馈给探索者AI,使其能够诊断失败的具体原因,从而提出更具针对性的改进方案。

三、搜索过程:五轮对话,价值39.9美元

整个搜索过程的运作方式类似于一场五轮的头脑风暴会议,只不过参与者是AI。

搜索使用的题库是AIME24(美国数学邀请赛2024年真题),这是一套对AI而言颇具挑战性的数学竞赛题目。探索者AI是Claude Code(一款擅长编程的AI助手)。每一轮中,Claude Code都会审视之前所有策略的评估结果和执行轨迹,分析其优劣与存在问题,然后直接修改代码提交一个新策略。新策略随即在离线回放环境中接受评估,结果与轨迹再次反馈给Claude Code,进入下一轮。

五轮结束后,研究团队选出在AIME24上表现最优的策略并固定下来,随后在未参与搜索的题目上测试其泛化能力。整个过程总计花费39.9美元和160分钟。相较于人工设计所需的大量试验与调整,这一代价极低。

从搜索过程的轨迹图中可以观察到一个有趣的演化模式。第一轮提出的策略过于激进地削减计算,导致准确率大幅下降。察觉到这一问题后,第二轮策略显著增加了计算预算,使准确率得以回升。随后的几轮交替进行效率优化与准确率提升,整体轨迹朝着更优的“准确率-计算量”权衡点移动,而非单纯追求单一指标。

四、被发现的策略:四种人类未曾设想的机制

最终发现的策略被研究团队命名为“置信度动量控制器”(Confidence Momentum Controller, CMC)。分析其内部逻辑,可以识别出四种在人工设计方法中从未出现过的机制。

第一个机制是“基于趋势的停止”。人工设计的方法通常依据“当前时刻的答案一致程度”来决定是否停止——例如,若当前有90%的路径给出相同答案,便停止推理。但CMC采用的是“指数移动平均”(EMA,可理解为一种平滑处理,使近期信息比早期信息权重更高)来追踪置信度的变化趋势。其停止条件是:置信度平均值足够高,且该平均值未呈下降趋势。这意味着系统不会因某一轮偶然出现答案集中而过早停止——它需要确认这种集中是稳定的,而非昙花一现。

第二个机制是“宽度与深度的耦合控制”。在CMC中,是否开辟新推理路径(增加宽度)与是否深化现有路径(增加深度)并非独立决策,而是通过同一个置信度趋势信号相互关联。当置信度趋势强劲上升时,表明现有路径正在产生有效信息,无需开辟新路径;当趋势停滞或下降时,则说明当前路径陷入瓶颈,此时应开辟更多路径以引入新视角。这形成了一个自动反馈回路,而人工设计的方法通常对宽度和深度的控制是相互独立的。

第三个机制是“对齐感知的深度分配”。CMC将所有活跃的推理路径分为三类:与当前主流答案一致的路径、持续给出不同答案的路径,以及中性路径。对齐路径会获得更多推理步骤,因为它们正在为最可能正确的方向贡献信息;中性路径获得标准的一步推进;偏离路径同样只获得一步推进,但若连续多轮都与主流答案不同,便会被放弃。这种差异化的资源分配使计算更集中于“有希望的方向”。

第四个机制是“保守的路径放弃”。CMC不会轻易放弃任何一条路径,必须连续多轮保持偏离才会触发放弃,且无论如何都会保留至少两条活跃路径。这种保守性防止了在信息不足时过早收窄探索范围。

这四个机制协同工作,形成了一个比任何现有人工设计方法都更为复杂的协调系统。研究团队指出,这种复杂程度已超出了人类直觉设计所能合理达到的边界。

五、实验结果:在多个场景下超越人工方法

研究团队在四个不同规模的Qwen3系列模型(参数量分别为0.6B、1.7B、4B、8B,B代表十亿)上评估了AutoTTS发现的策略,同时测试了三个未参与搜索的题库:AIME25(2025年数学竞赛题)、HMMT25(哈佛-麻省理工数学锦标赛2025年题目)和GPQA-Diamond(研究生级别的科学问答)。对比的基线包括四种人工设计方法:自我一致性(SC@64)、自适应停止采样(ASC)、早停自我一致性(ESC)和并行探测(Parallel-Probe)。

在准确率-计算量的权衡方面,AutoTTS发现的策略在大多数场景下均优于所有人工基线。以1.7B规模模型在AIME25上的结果为例:所有人工方法的准确率均在44.4%左右,而AutoTTS在β=1.0时达到了49.0%,提升近5个百分点,同时使用的词元数量(592.6万)也处于合理范围。在β=0.5的低预算设置下,准确率为46.7%,词元数量仅为327.9万,比SC@64的1054.1万减少了近70%,但准确率反而更高。

在8B规模模型上,AutoTTS在β=0.5时便能以255.3万词元达到84.3%的AIME24准确率,而SC@64需要910.8万词元才能达到80.4%。换言之,用不到三分之一的计算量,获得了更高的准确率。

在泛化测试中,将该策略应用于DeepSeek-R1-Distill-Llama-8B(一个架构完全不同的模型)时,在HMMT25上同样超越了所有人工基线,表明发现的策略并非针对特定模型过度拟合的结果。在GPQA-Diamond这类非数学任务上,AutoTTS同样表现出色,β=0.5时仅用151万词元便达到41.6%的准确率,而SC@64需要510万词元才达到41.3%。

研究团队还进行了消融实验以验证各个设计选择的必要性。移除单参数化约束后,发现的策略出现严重过拟合,词元使用量从57.5万骤降至9.3万,但准确率从53.1%下降至49.0%——意味着策略学会了用极少的计算“蒙”答案,而非真正解题。移除执行轨迹反馈后,策略无法有效诊断失败原因,最终使用了过多的词元(82.4万 vs 57.5万)且准确率更低,说明单纯的“结果好坏”反馈并不足够。

六、这项研究意味着什么

归根结底,这项研究完成了一件在技术上看似绕弯、实则至关重要的工作:利用AI来帮助设计让AI变得更聪明的方法。

过去,研究人员设计一套新的推理策略需要大量的专业知识、试错和参数调整。AutoTTS将这一过程转变为可自动化执行的流程。更关键的是,它改变了人类需要投入精力的方向:从设计具体策略,转变为设计“发现策略的环境”。这就像从亲手绘制地图,升级为搭建一套制图系统——后者一旦建成,便可反复使用,并能探索人类手绘地图时从未想到的区域。

对普通用户而言,这项研究的直接影响在于:未来使用AI工具时,相同的计算成本有望换来更准确的回答,或是在保持相同准确率的前提下显著降低计算成本(即更快、更便宜的服务)。对AI领域的研究人员来说,该框架为“如何高效利用推理时的计算资源”这一问题开辟了一条新的研究路径。

当然,这项研究也存在明确的局限性。当前的实例化仅涉及宽度和深度两个维度的控制,而现实中的AI推理空间远比此复杂,例如树形搜索、验证器引导的迭代改进等方向均未纳入。此外,搜索过程依赖Claude Code这类前沿编程AI,若换用开源模型能否取得类似效果,目前尚不清楚。

这项研究也提出了一个有趣的思考方向:如果连“如何设计策略”这件事都能交给AI自动完成,那么下一步是否会让AI自动设计“发现策略的环境”本身?这种递归式的自我改进路径,目前仍远未被充分探索。

Q&A

Q1:AutoTTS框架和人工设计推理策略相比,主要优势是什么?

AutoTTS的主要优势有两点。第一是搜索效率极高,整个发现过程仅需39.9美元和160分钟,因为它利用离线预收集的推理数据来评估策略,无需反复调用AI生成新内容。第二是能发现人类直觉难以设想的策略,例如最终发现的CMC控制器包含四种协同工作的机制,其复杂程度超出了人工设计的合理边界。

Q2:beta参数化在AutoTTS中起什么作用?

beta参数化是一种约束机制,强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数。此举旨在防止过拟合——参数越多,策略越容易仅在搜索所用的题目上表现良好,更换题目后便失灵。单参数化大幅缩小了搜索空间,使发现的策略更加稳健,能够泛化到未曾见过的题目和模型上。

Q3:AutoTTS发现的策略能用于不同类型的AI模型和任务吗?

实验结果表明其具备泛化能力。研究团队将在Qwen3系列模型上发现的策略,直接应用于DeepSeek-R1-Distill-Llama-8B这一架构完全不同的模型,以及在GPQA-Diamond这类非数学的研究生科学问答任务上,其表现均优于或持平于人工设计的基线方法,说明策略具有一定的跨模型、跨任务泛化能力。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。