马里兰大学等:让AI自己设计AI的"思考策略",推理效率提升近70%
马里兰大学等机构提出AutoTTS框架,让AI自主设计推理策略以优化“测试时扩展”。该框架通过离线回放环境、单参数化约束等设计,仅用少量成本自动搜索出高效策略。实验表明,新策略在多项任务中能以更低计算量获得更高准确率,其复杂机制超出人工设计范畴,展现了AI自我改进的潜力。

一项关于如何让AI“思考”得更聪明的研究,近期在学术圈引起了广泛关注。这项由马里兰大学、弗吉尼亚大学、华盛顿大学圣路易斯分校、北卡罗来纳大学、谷歌和Meta等多家机构联合完成的工作,已于2026年5月8日以预印本形式发布在arXiv平台,论文编号为arXiv:2605.08083。
想象一下,当你向朋友请教一道难题时,他有两种帮法:一是直接告诉你答案,二是自己先琢磨几遍,综合多个思路再给你一个更稳妥的答复。大型语言模型(也就是那些能写文章、解数学题的AI)面临的情况也类似。研究人员很早就发现,如果允许AI在解题时“多花点时间思考”——比如让它生成多个不同的推理过程,再从中挑选最优解——其表现会有显著提升。这种在“回答问题时投入额外计算资源”的技术,专业上称为“测试时扩展”。
但问题在于,如何分配这些额外的计算资源,长期以来一直依赖人工经验。研究人员需要手动规定:何时开辟新思路、何时砍掉无效路径、何时该停止并给出答案。这就像厨师凭感觉调味,配方因人而异,且难以解释其内在逻辑。而这项研究的核心突破,在于提出了一个名为AutoTTS的框架,让AI能够自主发现最高效的“思考策略”,从而摆脱对人类直觉设计的依赖。
一、为什么AI的“思考方式”值得专门研究
要理解这项研究的意义,不妨用一个备考的比喻来切入。
高考前,学生拥有固定的备考时间。他可以选择将所有时间押在一门学科上,也可以均匀分配,或是根据自身薄弱环节灵活调整。不同的时间分配策略,最终成绩往往天差地别。AI在回答问题时面临类似的抉择:它拥有一定的“计算预算”,可以选择同时探索多条推理路径,也可以让某条路径思考得更深入,或在过程中评估当前进展是否值得继续。
现有的方法大多基于研究人员的“经验设计”。例如,“自我一致性”方法会让AI同时生成64条推理路径,然后通过投票选出最普遍的答案——这好比让64个学生独立解题,再统计哪个答案出现次数最多。还有一些更复杂的方法,例如根据答案的稳定程度决定何时停止生成新路径,或在推理中途“剪除”看似偏离正轨的路径。
研究团队梳理这些方法后发现,它们都可以被视作在一个“宽度-深度”平面上移动的不同轨迹。宽度代表同时探索的路径数量,深度代表每条路径的延伸长度。64路自我一致性就是宽度拉满、深度固定的一个点;有些方法只调整宽度;有些只增加深度;还有些会先拓宽、再剪枝、最后深化。将这些方法置于同一张图中,它们就像棋盘上走出的不同路线。
这一视角揭示了一个关键洞察:这些人工设计的方法都只是“特殊案例”,其背后存在一个更广阔、尚未被充分探索的策略空间。既然大家都在同一个空间里探索,何不让AI自己去找出最优路线呢?
二、AutoTTS框架:让AI来设计AI的思考策略
AutoTTS的核心思路可以概括为“建造游乐场,而非亲手玩游戏”。
过去,研究人员直接设计一套思考规则交给AI使用。AutoTTS改变了这一分工:研究人员负责搭建一个“环境”——定义AI可以执行的动作、环境的状态以及何为好的结果——然后让另一个AI(探索者)在这个环境中自动寻找有效策略。
这一框架在设计上包含几个至关重要的技术决策,每一个都旨在解决实际的工程难题。
首先是构建“离线回放环境”。评估一个思考策略的好坏,通常需要实际运行AI来生成推理过程,这既耗时又昂贵。AutoTTS的解决方案是预先收集所有可能用到的推理数据:针对每道题目,提前让AI生成128条完整的推理路径,并每隔500个词元(token,可理解为AI处理的最小文字单位)记录一次当前的答案状态。建立这个数据库后,评估任何策略都无需再次调用AI——只需在已存储的数据上“回放”即可,就像通过比赛录像研究战术,而无需每次都重赛一场。这使得评估成本几乎可以忽略不计。
其次是“单参数化”(论文中称为beta参数化)。在早期试验中,探索者AI倾向于设计包含十几个可调参数的复杂策略。参数越多,搜索空间就越大,在有限的搜索轮次内极易导致过拟合——即找到的策略仅在用于搜索的那批题目上表现良好,换一批题目便失效。为解决此问题,研究团队强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数,且随着β增大,策略必须系统性地“更愿意投入计算资源”。这好比规定厨师只能用“辣度”一个旋钮来调整整道菜的风味,而非自由调节盐、糖、醋、辣椒的各自用量。这一约束极大地简化了搜索难度,并使发现的策略更加稳健。
第三个关键设计是“执行轨迹反馈”。仅仅告知探索者AI“该策略准确率为X%,消耗了Y个词元”,信息量远远不够——就像只告诉厨师“这道菜不好吃”,却不指出问题所在。为此,系统会记录每个策略在每道题目上的完整决策过程:何时开辟新路径、何时剪除某条路径、何时选择继续深化。这些细节被完整地反馈给探索者AI,使其能够诊断失败的具体原因,从而提出更具针对性的改进方案。
三、搜索过程:五轮对话,价值39.9美元
整个搜索过程的运作方式类似于一场五轮的头脑风暴会议,只不过参与者是AI。
搜索使用的题库是AIME24(美国数学邀请赛2024年真题),这是一套对AI而言颇具挑战性的数学竞赛题目。探索者AI是Claude Code(一款擅长编程的AI助手)。每一轮中,Claude Code都会审视之前所有策略的评估结果和执行轨迹,分析其优劣与存在问题,然后直接修改代码提交一个新策略。新策略随即在离线回放环境中接受评估,结果与轨迹再次反馈给Claude Code,进入下一轮。
五轮结束后,研究团队选出在AIME24上表现最优的策略并固定下来,随后在未参与搜索的题目上测试其泛化能力。整个过程总计花费39.9美元和160分钟。相较于人工设计所需的大量试验与调整,这一代价极低。
从搜索过程的轨迹图中可以观察到一个有趣的演化模式。第一轮提出的策略过于激进地削减计算,导致准确率大幅下降。察觉到这一问题后,第二轮策略显著增加了计算预算,使准确率得以回升。随后的几轮交替进行效率优化与准确率提升,整体轨迹朝着更优的“准确率-计算量”权衡点移动,而非单纯追求单一指标。
四、被发现的策略:四种人类未曾设想的机制
最终发现的策略被研究团队命名为“置信度动量控制器”(Confidence Momentum Controller, CMC)。分析其内部逻辑,可以识别出四种在人工设计方法中从未出现过的机制。
第一个机制是“基于趋势的停止”。人工设计的方法通常依据“当前时刻的答案一致程度”来决定是否停止——例如,若当前有90%的路径给出相同答案,便停止推理。但CMC采用的是“指数移动平均”(EMA,可理解为一种平滑处理,使近期信息比早期信息权重更高)来追踪置信度的变化趋势。其停止条件是:置信度平均值足够高,且该平均值未呈下降趋势。这意味着系统不会因某一轮偶然出现答案集中而过早停止——它需要确认这种集中是稳定的,而非昙花一现。
第二个机制是“宽度与深度的耦合控制”。在CMC中,是否开辟新推理路径(增加宽度)与是否深化现有路径(增加深度)并非独立决策,而是通过同一个置信度趋势信号相互关联。当置信度趋势强劲上升时,表明现有路径正在产生有效信息,无需开辟新路径;当趋势停滞或下降时,则说明当前路径陷入瓶颈,此时应开辟更多路径以引入新视角。这形成了一个自动反馈回路,而人工设计的方法通常对宽度和深度的控制是相互独立的。
第三个机制是“对齐感知的深度分配”。CMC将所有活跃的推理路径分为三类:与当前主流答案一致的路径、持续给出不同答案的路径,以及中性路径。对齐路径会获得更多推理步骤,因为它们正在为最可能正确的方向贡献信息;中性路径获得标准的一步推进;偏离路径同样只获得一步推进,但若连续多轮都与主流答案不同,便会被放弃。这种差异化的资源分配使计算更集中于“有希望的方向”。
第四个机制是“保守的路径放弃”。CMC不会轻易放弃任何一条路径,必须连续多轮保持偏离才会触发放弃,且无论如何都会保留至少两条活跃路径。这种保守性防止了在信息不足时过早收窄探索范围。
这四个机制协同工作,形成了一个比任何现有人工设计方法都更为复杂的协调系统。研究团队指出,这种复杂程度已超出了人类直觉设计所能合理达到的边界。
五、实验结果:在多个场景下超越人工方法
研究团队在四个不同规模的Qwen3系列模型(参数量分别为0.6B、1.7B、4B、8B,B代表十亿)上评估了AutoTTS发现的策略,同时测试了三个未参与搜索的题库:AIME25(2025年数学竞赛题)、HMMT25(哈佛-麻省理工数学锦标赛2025年题目)和GPQA-Diamond(研究生级别的科学问答)。对比的基线包括四种人工设计方法:自我一致性(SC@64)、自适应停止采样(ASC)、早停自我一致性(ESC)和并行探测(Parallel-Probe)。
在准确率-计算量的权衡方面,AutoTTS发现的策略在大多数场景下均优于所有人工基线。以1.7B规模模型在AIME25上的结果为例:所有人工方法的准确率均在44.4%左右,而AutoTTS在β=1.0时达到了49.0%,提升近5个百分点,同时使用的词元数量(592.6万)也处于合理范围。在β=0.5的低预算设置下,准确率为46.7%,词元数量仅为327.9万,比SC@64的1054.1万减少了近70%,但准确率反而更高。
在8B规模模型上,AutoTTS在β=0.5时便能以255.3万词元达到84.3%的AIME24准确率,而SC@64需要910.8万词元才能达到80.4%。换言之,用不到三分之一的计算量,获得了更高的准确率。
在泛化测试中,将该策略应用于DeepSeek-R1-Distill-Llama-8B(一个架构完全不同的模型)时,在HMMT25上同样超越了所有人工基线,表明发现的策略并非针对特定模型过度拟合的结果。在GPQA-Diamond这类非数学任务上,AutoTTS同样表现出色,β=0.5时仅用151万词元便达到41.6%的准确率,而SC@64需要510万词元才达到41.3%。
研究团队还进行了消融实验以验证各个设计选择的必要性。移除单参数化约束后,发现的策略出现严重过拟合,词元使用量从57.5万骤降至9.3万,但准确率从53.1%下降至49.0%——意味着策略学会了用极少的计算“蒙”答案,而非真正解题。移除执行轨迹反馈后,策略无法有效诊断失败原因,最终使用了过多的词元(82.4万 vs 57.5万)且准确率更低,说明单纯的“结果好坏”反馈并不足够。
六、这项研究意味着什么
归根结底,这项研究完成了一件在技术上看似绕弯、实则至关重要的工作:利用AI来帮助设计让AI变得更聪明的方法。
过去,研究人员设计一套新的推理策略需要大量的专业知识、试错和参数调整。AutoTTS将这一过程转变为可自动化执行的流程。更关键的是,它改变了人类需要投入精力的方向:从设计具体策略,转变为设计“发现策略的环境”。这就像从亲手绘制地图,升级为搭建一套制图系统——后者一旦建成,便可反复使用,并能探索人类手绘地图时从未想到的区域。
对普通用户而言,这项研究的直接影响在于:未来使用AI工具时,相同的计算成本有望换来更准确的回答,或是在保持相同准确率的前提下显著降低计算成本(即更快、更便宜的服务)。对AI领域的研究人员来说,该框架为“如何高效利用推理时的计算资源”这一问题开辟了一条新的研究路径。
当然,这项研究也存在明确的局限性。当前的实例化仅涉及宽度和深度两个维度的控制,而现实中的AI推理空间远比此复杂,例如树形搜索、验证器引导的迭代改进等方向均未纳入。此外,搜索过程依赖Claude Code这类前沿编程AI,若换用开源模型能否取得类似效果,目前尚不清楚。
这项研究也提出了一个有趣的思考方向:如果连“如何设计策略”这件事都能交给AI自动完成,那么下一步是否会让AI自动设计“发现策略的环境”本身?这种递归式的自我改进路径,目前仍远未被充分探索。
Q&A
Q1:AutoTTS框架和人工设计推理策略相比,主要优势是什么?
AutoTTS的主要优势有两点。第一是搜索效率极高,整个发现过程仅需39.9美元和160分钟,因为它利用离线预收集的推理数据来评估策略,无需反复调用AI生成新内容。第二是能发现人类直觉难以设想的策略,例如最终发现的CMC控制器包含四种协同工作的机制,其复杂程度超出了人工设计的合理边界。
Q2:beta参数化在AutoTTS中起什么作用?
beta参数化是一种约束机制,强制要求所有策略只暴露一个参数β,其他所有内部参数都必须是β的确定性函数。此举旨在防止过拟合——参数越多,策略越容易仅在搜索所用的题目上表现良好,更换题目后便失灵。单参数化大幅缩小了搜索空间,使发现的策略更加稳健,能够泛化到未曾见过的题目和模型上。
Q3:AutoTTS发现的策略能用于不同类型的AI模型和任务吗?
实验结果表明其具备泛化能力。研究团队将在Qwen3系列模型上发现的策略,直接应用于DeepSeek-R1-Distill-Llama-8B这一架构完全不同的模型,以及在GPQA-Diamond这类非数学的研究生科学问答任务上,其表现均优于或持平于人工设计的基线方法,说明策略具有一定的跨模型、跨任务泛化能力。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















