当前位置:

首页 > 硬件相关 > 独立研究者提出的Agon框架颠覆了AI自我训练的固有思路

独立研究者提出的Agon框架颠覆了AI自我训练的固有思路

Agon框架通过让两个模型互相成为隐式裁判,引入竞争压力与转化奖励,使AI在极难数学题上正确率从23%提升至61%,推理过程从8100字缩短至3500字,有效解决了传统强化学习只重结果导致的推理冗余问题。

这项研究以预印本形式公开,论文编号为arXiv:2607.07690,发布于2026年7月8日,研究者来自独立机构thinkdense.ai。

在AI的世界里,有一个老问题一直让人头疼:怎么让AI学会“更好地思考”,而不是“思考更多”?

你让AI解一道难题,它可能洋洋洒洒写上几千字,翻来覆去地说“嗯…等等…我再想想…”,绕了一大圈,最后可能运气好就答对了。但仔细翻看那长篇大论,大部分都是原地打转,真正有价值的推理步骤少得可怜。这就好比一个学生考试时,与其在草稿纸上密密麻麻写满反复涂改的尝试,倒不如清晰写出三步推理直接解决问题——但偏偏现有的AI训练方法更容易培养出前者。

这个问题的根源在于目前最主流的AI强化学习训练方式,也就是所谓的“只看结果、不看过程”。训练系统会给AI出一道题,AI生成一堆解题过程,最后只看最终答案对不对,对了就打高分,错了就打低分。中间那长长的推理过程?没人评分。于是AI很快学会了一个取巧的策略:既然过程没人管,那就尽量多写,多试几次,碰运气总有一次答对。结果呢?AI的废话越来越多,真正有用的推理能力却没怎么长进。研究数据显示,经过标准训练后,AI生成的文字量可以膨胀十倍,但准确率的提升却微乎其微。

这项新研究提出了一个名为Agon(取自古希腊语,意为“竞赛”)的全新框架,它用一个极为巧妙的方法绕开了这个难题:既然没办法直接给推理过程打分,那就让另一个AI来“隐式”评判它。

一、为什么自己盯着自己的卷子,永远找不到错误

要理解Agon为什么有效,先得搞清楚为什么让AI自己检查自己的推理,效果很差。

麻省理工学院等机构的研究者早就发现,大型语言模型在没有外部反馈的情况下自我纠错,往往是徒劳的。这背后有一个非常直觉性的道理:导致你犯错的那个“盲点”,同样也会让你在自查时看不见那个错误。用生活中的例子来说,一个人写了一篇文章,里面有一个逻辑谬误,但他自己偏偏就是看不出来——因为他脑子里的思路从一开始就认为那个推理是对的。叫他自己改稿,他改一百遍也不会发现那个漏洞。但是换一个思维方式不同的人来读,可能一眼就看出来了。

现有的“自我博弈”类AI训练方法,本质上就是让AI和自己的过去版本下棋、和自己的历史答案较劲。这的确能带来一些提升,但很快就会触顶——因为整个系统里的“裁判”和“选手”本质上是同一批盲点的产物。Agon的核心洞见正在于此:真正有效的外部评判,必须来自一个有着不同失误模式的对手。

Agon的做法是:训练两个模型,让它们互相成为对方的“隐式裁判”。

二、竞赛规则:一个出题、一个挑战,轮流做“选手”

Agon的运作方式,其实有点像一场即兴辩论赛。

每一轮训练开始,两个模型——姑且叫它们模型A和模型B——面对同一道难题。模型A先作答,写出自己的完整解题过程,然后系统会把A的解题总结(注意,不是那冗长的内心独白,而是它写出的正式解题步骤摘要,而且最终答案会被遮住)提供给模型B看。B在看完A的解题摘要之后,再去解同一道题。

B此时的任务不仅仅是解对题,还要超越A。如果A解错了而B解对了,B会得到额外的“转化奖励”——相当于额外加分。这就是竞争的核心:赢了弱对手没什么意思,关键是在对手犯错的时候你没犯错,那才是真本事。

在这个过程中,B看了A的解题摘要,实际上等于隐式地评估了A的推理质量。如果A的推理有漏洞,比如在某一步骤中搞错了正负号,而B从A的摘要中发现了这个问题并加以利用,那么A那条错误的推理就通过“竞争失败”这个结果得到了惩罚。整个过程中,没有人专门标注“哪一步推理好”“哪一步推理烂”,裁判完全由对手的表现来充当,干净、自然、不需要额外的人工标注。

为了防止某一个模型永远只当“出题者”或永远只当“挑战者”而导致能力偏科,每一步训练之后两个模型会互换角色。A负责出题的那一轮,B来挑战;下一轮B出题,A来挑战。就这样轮流切换,两个模型都在同时练习“从零解题”和“读懂对手、超越对手”这两种技能。

三、奖励机制的精妙之处:为什么不能简单地“赢了加一分”

Agon在奖励设计上花了不少心思,这里有一个容易踩的坑值得专门解释一下。

最直觉的竞争奖励可能是:B对了A错了,B加分;B错了A对了,B扣分;两个都对或都错,平局。这听起来很合理,但实际上有严重问题。因为A的对错是A自己的事,B的分数不应该受到A结果的“扣分”影响——数学上可以证明,这种“减去对手得分”的形式,在GRPO这种按组内平均标准化计算优势的训练框架下,相当于给每道题加了一个对B毫无方向性指导的噪音,最终和根本没有竞争压力的效果差不多,实验数据也印证了这一点(49分,接近合作模式的46分)。

真正有效的奖励是“转化奖励”:B答对,并且A答错,这个组合才触发额外奖励。用公式来表达就是:奖励额外部分 = B答对 × (1 - A答对)。这个乘法结构的妙处在于,它把“竞争加分”直接嵌进了“B自身的答对”这个行为上,而不是从B的基础分里扣掉什么。这样,奖励对B的行为有清晰的方向性:在那些A都搞不定的难题上答对,是最值钱的。

更关键的是,每个挑战者B的8次尝试(训练时每题生成8个答案作为一组),每次都对应A的一个不同解题摘要,所以同一组里的“对手难度”是各不相同的。这种组内差异让“转化奖励”在数学上真正产生了方向性梯度,告诉B应该往哪个方向学。如果8次尝试都面对同一个A的答案(这是一个对照实验中的设置),那么对手难度在组内是固定不变的,转化奖励在标准化之后就会抵消掉,相当于没有竞争压力,实验结果也确实只有32分,和标准GRPO的30分相差无几。

四、两个模型,却几乎只需要一个模型的计算资源

这个方法听起来很美,但第一个实际问题就来了:养两个模型,不就是双倍的计算成本吗?

研究者的解决方案相当聪明:两个模型共享同一个冻结的基础模型,各自只是在上面挂了一套“LoRA适配器”(一种只训练一小部分参数、其余参数保持不变的高效微调技术)。这就好像两个人共用一套百科全书,但各自有一本不同的笔记本在旁边补充记录自己独特的心得。那本共享的百科全书是固定的,各自的笔记本才需要更新训练。

每个LoRA适配器大约只有1000万个参数,相当于整个基础模型的约2%。也就是说,从一个模型升级到Agon的双模型竞争框架,额外的内存开销大概只有2%,而不是100%。这在工程上是完全可接受的。

两个适配器从不同的初始状态出发——一个从标准的零初始化开始,另一个从一个随机扰动的初始状态开始——加上每步轮换角色带来的不同训练梯度,让两个看似几乎一样的模型随着训练的推进,逐渐发展出不同的“思维盲点”,从而真正形成互补。

五、实验结果:数字背后的真实含义

研究者在一个叫做DeepMath-hard的极难数学题数据集上测试了Agon,这个数据集的题目对于0.6亿参数的小模型而言堪称噩梦级别,零样本情况下(不做任何特殊训练,直接让模型答题)的正确率只有23%。

经过标准的GRPO强化学习训练,正确率提升到了30%——提高了7个百分点,代价是模型生成的文字量从平均6100字膨胀到了8100字。印证了前面说的“废话变多但能力没多大提升”的问题。

如果在推理时让两个原版模型互相看对方的答案并修改自己的答案(这叫“Mixture-of-Agents”,即混合智能体方法,不需要特殊训练),正确率是34%——比单模型GRPO多4个百分点,但这4个百分点的提升成本是两倍的推理计算量。

换成Agon——同样两次推理的计算量,正确率直接跳到了61%。这是零样本基线的2.65倍,是标准GRPO的两倍多,是无训练混合智能体方法的1.8倍。

更耐人寻味的是,Agon的最终推理过程反而变短了:平均只有3500字,而标准GRPO是8100字。也就是说,Agon不仅答得更准确,还说得更简洁。这个缩短效果并不是人为加了“少说废话”的奖励触发的,而是竞争压力的自然产物——当有另一个模型在对面盯着你的解题思路找漏洞时,你自然会把真正有价值的步骤写出来,而不是用大量探索性废话来凑数。

在这31个百分点的总提升中,“信息交流”这个因素(让模型看到对方的解题思路)贡献了约16个百分点,“竞争压力”这个因素(在看到对方答案的基础上再引入转化奖励)又额外贡献了约15个百分点。两者对最终效果的贡献旗鼓相当。

这两个核心结论——交流有效、竞争比合作更有效——在统计上都超过了置信区间的误差范围(在300道题的样本上,双侧95%置信区间约为±5.5个百分点),可以被视为可靠的结论。

六、举一反三:小模型受益更大,换个领域也管用

研究者还在不同规模的模型上测试了Agon,结论非常直接:模型越小,Agon带来的提升越大。0.6B(6亿参数)的小模型提升了31个百分点,1.7B的提升了24个百分点,4B的提升了12个百分点。这个规律背后有直觉性的解释:越小的模型越难对付困难题目,越处于那个“废话增多但准确率不升”的困境,所以竞争框架带来的改变也越显著。

经过Agon训练的0.6B小模型(正确率61%)在这个数据集上甚至超越了零样本状态下的4B模型(正确率52%),也超越了经过标准GRPO训练后的4B模型(正确率59%)。也就是说,7倍大的模型按常规方式训练,反而打不过Agon加持的小模型。

同样的框架在Qwen3.5系列和Gemma 4系列模型上也验证了同样的排序规律,证明这不是某个特定模型家族的偶然特性。

此外,研究者还把Agon用在了竞争性编程代码生成领域,用单元测试通过率代替数学答案正确性作为评判标准。结果同样呈现同样的规律:标准GRPO是24%,合作模式是29%,Agon是34%,代码生成时的推理过程也相应缩短了。代码领域的绝对提升幅度小于数学,部分原因是代码题的对手摘要更长,给推理过程带来更多“噪音”,但方向性结论是一致的。

为了验证这些提升不是因为模型在数学训练集上“背题”造成的,研究者还在GSM8K(一个常见的初中数学题集)和MATH-500(高中难度综合题集)上做了转移测试,不做任何额外训练,直接用在DeepMath上训练好的Agon模型去答题。结果显示,在GSM8K上正确率从62%提升到了75%,在MATH-500上从45%提升到了64%,排序与训练集上的表现一致,说明Agon带来的是泛化性的推理能力提升,而不是对特定题目的过拟合。

七、一些值得诚实说明的局限与开放问题

这项研究在结论部分非常诚实地列出了若干局限,这是值得认可的做法。

首先,Agon需要一个“验证器”——一个能够自动判断答案对错的机制。数学题和编程题有标准答案,验证器很好搭建,但对于那些没有唯一正确答案的开放性任务(比如写作、策略分析),Agon目前无法直接应用。

其次,两个模型之间“势均力敌但行为各异”这个条件,在现有的双适配器实现中只是一个被维护的假设,而不是一个被精确量化的属性。研究者坦承,两个适配器在训练初期几乎一模一样(只有微小的随机初始化差异),能否在训练过程中真正发展出有意义的互补性,目前只是一个“假说”,并没有被单独测量验证。

再者,每个训练配置只跑了一次(单次实验),没有重复多次取平均,这意味着数字本身有一定的随机性,具体数值可能会随训练随机性而波动。研究者明确说明了这一点,要求读者在解读那些接近置信区间边缘的数值时保持谨慎。

还有一个有趣的悬而未决的问题:论文中“没有信息交流但有竞争压力”这个理论格子,在当前实现下由于数学原因是“自动失效”的——如果挑战者根本看不到对手的解题思路,对手的对错在组内就是一个常数,那个竞争奖励项在数学归一化之后就消失了。这意味着“纯竞争(无交流)”到底有没有独立价值,目前的实验设计无法给出明确答案,需要另外设计实验来研究。

最后,Agon的推理部署是两阶段串行的——先让一个模型出答案,再让另一个模型读后输出最终答案——这意味着实际推理时间是单模型的两倍。研究者也坦承,所有“更短的推理过程”的比较,都只比较了第二阶段(挑战者阶段)的长度,并没有把第一阶段(起草者阶段)的生成长度算进去,完整的推理算力账还有待更细致的核算。

八、下一步:让两个AI不用说话、直接交换思维

研究者在展望部分提出了一个非常前沿的研究方向:目前两个模型之间的“交流”是通过自然语言(文字)进行的,而语言是有带宽限制的——很多模型“知道”的东西,它们并不能完整地用语言表达出来。

如果能让两个适配器直接在“隐状态”(模型内部的数值向量,也就是模型真正的思维媒介)层面交换信息,绕过语言这个瓶颈,理论上可以传递远比文字更丰富的推理信息。这可以通过让一个模型的中间层激活值直接注入另一个模型的上下文来实现(技术上叫做KV-cache注入或门控潜在空间桥接)。研究者把这称为“让它们在潜在空间中共同推理”,并明确将其列为未来最重要的研究方向。

另外,研究者还提到了一个颇具启发性的“密度调节”方向。实验中发现,当竞争对手的解答也是正确的时候,额外设置一个“用更少的字比对手解对同一道题”的加分项,可以在准确率几乎不变(从61%降到60%)的前提下,把推理过程从平均3500字进一步压缩到2600字。这意味着竞争框架不仅可以用来提升准确率,还可以作为一个可调节的旋钮,有目标地优化推理效率。

说到底,Agon做的事情,用一句话来概括就是:把AI的“自我评判”问题,变成了一场由结果来说话的竞赛。不需要专家标注哪个推理步骤是好的、哪个是多余的,不需要训练一个专门评判推理质量的额外模型,甚至不需要改动现有的训练框架——只需要让另一个有着不同思维盲点的模型来“隐式地”告诉你,你的推理哪里被人抓住了漏洞。在数字上,这让一个小模型在极难数学题上的正确率翻了两倍多;在工程上,这几乎不带来额外的计算成本;在理论上,这开辟了一个全新的思路:AI模型的训练信号,可以来自同伴的竞争,而不只是来自自己的回顾。

这项研究的更多细节,包括完整的实验数据、数学推导和代码细节,可以通过论文编号 arXiv:2607.07690 在arXiv预印本平台上查阅完整原文。

Q&A

Q1:Agon框架和普通的让两个AI互相参考答案有什么本质区别?

A:普通的多模型合作(比如Mixture-of-Agents)是让模型看完对方的答案后修改自己,目标是“达成共识”。Agon的核心差异在于竞争压力:挑战者不是为了和起草者达成一致,而是为了在起草者犯错的地方答对,额外获得“转化奖励”。这种奖励结构让模型主动学会识别对手推理中的漏洞,而不是跟着对手的思路走,最终形成的能力是互补的,而不是趋同的。

Q2:Agon训练出来的模型推理变短了,是因为被惩罚了废话吗?

A:不是。Agon的主要奖励函数里完全没有长度惩罚项。推理变短是竞争压力的自然副产品:挑战者在阅读对手的解题思路后,已经知道了解题的大致方向和哪些路走不通,不需要重复那些无效探索,所以自然而然地变得更简洁。这种缩短效果是涌现出来的,并不是被强制要求的。研究者另外设置了一个可选的“长度决胜项”,可以进一步把推理从3500字压缩到2600字,但那是独立于主要框架的附加选项。

Q3:Agon需要什么特殊的训练基础设施才能运行?

A:基本上不需要。Agon被设计为可以在标准的GRPO训练框架上直接运行,无需修改优化器的核心代码。两个模型以LoRA适配器的形式共享一个冻结的基础模型,额外内存开销约为2%。研究者使用的是开源的vLLM推理框架和TRL训练库,都是业内常用工具。唯一需要特别处理的工程点是:每次训练步骤需要先跑一遍起草者生成答案摘要,再把摘要拼入挑战者的输入上下文,实现上需要协调两次生成的时序,但这并不需要定制硬件或专有框架。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。