商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 俄勒冈州立大学等联合研发:让AI团队像真正的团队一样"进化"

俄勒冈州立大学等联合研发:让AI团队像真正的团队一样"进化"

  发布于2026-05-25 阅读(0)

扫一扫,手机访问


一项由俄勒冈州立大学、威斯康星大学麦迪逊分校、强生公司和宾夕法尼亚州立大学联合开展的研究,近期以预印本形式发布在arXiv平台上,论文编号为arXiv:2605.11136。

一、一个关于“团队合作”的根本性问题

想象一下,你管理着一支由五位顾问组成的团队。每当遇到难题,你是让他们各自埋头苦干然后汇总答案,还是组织他们真正协作——强项互补、经验共享、分工明确?答案显而易见,后者才是高效团队的精髓。

然而,在人工智能领域,长期以来的主流做法却更像是前者:把好几个AI模型并排摆在一起,各自为政,最后充其量来个“多数投票”——哪个答案出现次数多就听谁的。

这个矛盾引起了研究团队的注意。他们观察到一个奇怪的现象:当任务难度极高,每个AI单独解决的成功率只有20%时,“多数投票”策略会彻底失效。原因很简单,正确答案恰恰是少数派,反而会被海量的错误答案“淹没”。数学计算可以证实:五个成功率20%的AI,多数投票后得到正确答案的概率会骤降至约5.8%,比单打独斗还要糟糕。

正是这个悖论,促使研究者提出了一个更根本的问题:我们能否让多个AI真正像一支有机的团队那样持续进化,而不是把单个AI的学习过程简单地重复N遍?他们的答案是肯定的,并为此设计了一个名为EVOCHAMBER的框架。这个框架的妙处在于,它能让AI团队在完全不需要重新训练的情况下,仅凭任务经验的积累就实现自发进化。

二、进化的三个层次:为什么“多个AI各自学习”还不够

要理解EVOCHAMBER的核心,不妨用一家咨询公司来打个比方。公司里有几十位顾问,每次接到新项目,管理层都需要思考几个问题:该派哪几个人去?他们之间如何分工协作?一个顾问在项目中学到的东西,怎样才能分享给其他人?公司的人员结构,是否需要随着业务变化而调整?

这四个问题,恰好对应了EVOCHAMBER所定义的三个进化层次。

首先是“个人层次”。每个AI都维护着一份属于自己的私有经验记忆库。每次完成任务后,AI会复盘自己的思考过程、团队的最终答案以及任务结果,从中提炼出两类知识:一类是针对特定领域的专项策略(比如解某种代数题的技巧),另一类则是跨领域通用的元认知洞见(比如“遇到复杂问题先分解”)。这些知识被分门别类地存储起来。下次遇到类似任务,AI会从自己的记忆库中检索最相关的条目,作为解题的参考背景。同时,每个AI还有一个动态更新的“能力评分”,记录自己在各类任务上的历史表现,近期表现的权重更高。

其次是“团队层次”,这决定了由谁去执行任务以及如何合作。这里的关键在于,不能每次都只派“最强的三个人”。那样做,强者会垄断所有经验,其他人得不到成长,团队的多样性也会丧失。为此,研究团队设计了三个互补的角色:

  • 锚定者:当前该类任务中表现最佳的AI,负责把握主体方向。
  • 补充者:从剩余AI中选出,选择标准是既要在该任务类型上有一定能力,又要与锚定者有过良好合作记录,同时其风格最好能与锚定者形成互补。
  • 探索者:专门从很少接触这类任务的AI中选出,目的是拓宽团队的经验覆盖面。

团队成员确定后,锚定者还需要从四种协作模式中选择一种:投票(各自作答后取多数)、辩论(各自给出答案并互相质疑)、生成-评审(一人出方案,其他人专挑漏洞)、分解(将问题拆解成模块各自负责)。具体选择哪种模式,由锚定者根据以往经验判断,而这种判断能力本身也会随着时间不断学习和改进。

最后是“种群层次”,它管理着整个AI池的知识流动和成员结构。这是EVOCHAMBER与以往所有方法最本质的区别,也是其最精妙的部分。

三、CODREAM:让知识从强者流向弱者,而不是均匀广播

种群层次的核心机制叫做CODREAM,全称“协作梦境”。这个名字听起来有些玄妙,但原理非常直观:当团队任务失败,或者成员之间出现严重意见分歧时,就会触发一次深度的集体反思。其核心目的,是将强者的经验精准地传递给弱者。

为什么叫“梦境”?因为这个过程发生在任务完成之后,是一种“回顾性学习”——就像我们白天经历挫折,晚上大脑会在梦境中整理和消化这些经验一样。

一次完整的CODREAM反思会议分为五个步骤:

  1. 反思:每个成员私下审视自己这次哪里做对了、哪里做错了。
  2. 对比:将失败者和成功者放在一起比较,提炼出“成功者到底做了什么不一样的事情”。
  3. 想象:将这些差异转化为可应用于未来类似情境的策略性假设,并标注其适用的问题类型。
  4. 辩论:团队成员互相批评对方提出的策略,淘汰那些站不住脚的假设。
  5. 结晶:将通过辩论考验的洞见整理成结构化条目,每条都标注其适用级别(仅适用于具体问题、适用于某个子领域,还是跨领域通用)和适用范围。

最关键的一步发生在这之后:这些结晶出的知识,并不会广播给所有AI,而是精准地写入那些在该类任务上表现低于团队中位数的AI个体。换句话说,知识是从强者流向弱者,而不是均匀地稀释给每个人。这个区别至关重要——把专门针对代数题的技巧灌输给一个已经精通代数的AI,只会增加干扰信息;但把同样的技巧给到一个在代数上存在短板的AI,才能真正弥补差距。

对照实验的数据有力地证明了这一点:当研究团队保留20个AI以及完整的团队组建和生命周期管理机制,但唯独关掉CODREAM环节时,整体表现与单个AI完全一样。这意味着,在没有跨智能体知识传递的情况下,无论团队组建得多精心,其效果也无法超越单个个体的简单叠加。只有加上CODREAM,团队才真正实现了“1+1>2”。

四、生命周期管理:AI团队的“新陈代谢”

种群层次的另一半是生命周期管理。系统会每隔固定数量的任务,检查一次整个AI池的状态,并根据情况执行四种核心操作:

  • 分裂:针对在某类任务中持续表现优秀的AI,克隆一个副本,并赋予其略微不同的专注方向。克隆体继承原AI的全部记忆,但从此独立积累经验,可能探索出相邻的新能力方向。
  • 合并:当两个AI的能力分布几乎完全重叠时,将它们合并成一个,同时继承两者的全部记忆,以避免资源浪费。
  • 修剪:当某个AI连续多次表现明显低于团队平均水平时,直接将其淘汰。
  • 创生:当遇到某类全新任务,而池子里没有任何AI在此类任务上有经验积累时,孵化一个专门针对此类任务的新AI,从零开始积累经验。

此外,还有第五种操作“专化”,它不改变AI的数量,而是调整某个高表现AI的性格定位,使其在未来的团队组建中更容易被识别为对应领域的专家。

这套生命周期机制解决了一个关键问题:随着任务流的不断变化,团队的结构也应该动态调整。这就像一家运转良好的公司,不会在业务转型时依然维持过时的部门架构,而是会招聘新人才、整合重叠职能、优化人员结构。

五、实验验证:在三条不同难度的赛道上测试

为了全面评估EVOCHAMBER的性能,研究团队设计了三条涵盖不同领域和难度的任务流。

第一条是“困难数学流”,包含262道高难度数学题(来自MATH数据集的4/5级题目)和四年AIME竞赛题(每年30道),共计382道题。AIME题目对AI而言挑战性极高,单个AI的成功率通常在10%到17%之间。

第二条是“困难编程流”,包含257道MBPP+题目(中等难度编程题)和165道CodeContests题目(竞赛级编程题),共计422道题。这条任务流旨在测试AI能否将在较易任务上学到的调试技巧迁移到更难的题目上。

第三条是“AFlow综合流”,将六个不同领域(数学应用题、多跳问答、编程、高难数学、代码评估、复杂推理)的100道题依次排列,组成600道题的任务流,专门测试AI在频繁切换领域时能否保持性能。

测试主要基于Qwen3-8B模型(可在单块GPU上运行),并辅以GPT-4.1-mini进行跨模型验证。

在困难数学流上,EVOCHAMBER整体准确率达到63.9%,比最强的基线方法MemCollab高出32%(相对幅度),是单个AI表现的两倍以上。在最难的AIME 2024题目上,EVOCHAMBER达到了40%的准确率,而前文提到的“多数投票”方法仅有3.3%——这完美印证了开头提出的“多数投票在低成功率下会适得其反”的问题。

在困难编程流上,所有方法在相对容易的MBPP+题目上都趋向于高分,真正拉开差距的是竞赛级的CodeContests题目。EVOCHAMBER在该子集上达到35.2%的准确率,是单个AI的5倍多。值得注意的是,另外两种具备记忆机制的对比方法EvoMem和MemCollab,在这个子集上的表现竟然比单个AI还差。研究团队分析认为,这是因为它们的记忆机制在没有精准筛选和路由的情况下引入了噪声,反而造成了干扰。

在综合流上,EVOCHAMBER以87.1%的总体准确率超越所有基线方法,尤其在高难数学(82%)和编程(84.3%)这两个需要跨任务知识迁移的领域,优势最为明显。

当换用更强的GPT-4.1-mini模型测试时,由于该模型本身在许多任务上表现就很好,提升空间相对较小,但EVOCHAMBER依然保持领先。在AIME题目上,基于GPT-4.1-mini的EVOCHAMBER达到了79.6%的整体准确率,比单个GPT-4.1-mini高出10.7个百分点。

六、消融实验:拆解每一块贡献

为了确认框架中每个设计模块的具体贡献,研究团队逐一“拆除”各个组件,在综合流上观察性能变化。

将精细的团队组建(基于能力评分和互补性选择)替换为随机组队,整体性能下降2.4个百分点。将智能的协作结构选择替换为强制使用投票,性能下降3.0个百分点。这两个数字表明,团队层面的设计确实有效,但效果有限。

然而,当把最核心的CODREAM机制整体关掉时,性能骤降10.8个百分点。这种下降在依赖多步推理的任务上尤为剧烈:多跳问答从89.5%跌至57.2%,复杂推理从86.0%跌至48.0%,差距极为悬殊。这强有力地证实了,跨智能体的非对称知识传递是整个框架中最核心的驱动力。

研究团队还做了一个更干净的对照实验:从综合流中取出30道数学题,比较三种配置——单个AI、保留20个AI的全部框架但关掉CODREAM、保留全套完整方案。结果发现,第一种和第二种配置得分相同,而第三种配置高出10.5%。这说明,多个AI的框架本身并不产生增益,真正的增益来源于AI之间高效的知识流动机制。

此外,将任务顺序随机打乱,并用两个不同的随机种子重新运行实验,EVOCHAMBER的优势非但没有下降,反而略有提升(从63.9%升至65.5%和66.2%),彻底排除了“任务顺序恰好有利”的偶然性解释。当AI池的大小从3个变化到20个时,最终的整体性能仅相差1.1个百分点,这表明生命周期机制能够自动将有效团队规模调节到合适水平。

七、最令人印象深刻的发现:专家从零自发涌现

除了硬性的性能数字,研究团队还详细分析了整个382题运行过程中AI池的变化轨迹,发现了一些用数字难以概括的、有趣的现象。

20个完全相同的AI从空白状态起步,没有任何一个被预先指定负责哪类任务。随着任务流的推进,一个稳定的分工格局自发形成了:每个任务类别都逐渐汇聚出一个主力专家,而且不同类别的主力专家各不相同。更有意思的是,负责AIME 2024题目的专家,在AIME 2024题目出现之前几乎毫无存在感,直到对应的题目开始出现才突然被“激活”。专家化不是预设的,而是按需涌现的。

知识的传递轨迹也不是均匀扩散的,而是沿着特定的通道流动——几个固定的“贡献者”反复向几个固定的“接收者”传递洞见,形成了清晰的结构化网络,而非随机的点对点联系。领导力也随着任务难度动态变化:在相对容易的高难数学阶段,领导权在几个AI之间交替轮换;进入最难的AIME阶段,领导权越来越集中在最适合的那个AI身上,团队的专化指数随难度上升而攀升。

用不同的随机种子重复三次实验,这些结构性规律每次都复现,但具体是哪个AI成为哪类任务的专家,则每次都不相同。模式是稳定的,身份是随机的——这正是真正的“涌现”现象的标志:它不是被编程进去的,而是从底层规则中自发生长出来的。这种现象,用一个单独的AI永远无法复现,因为它本质上是多个智能体相互作用的产物。

八、CODREAM产出了哪些真实知识

研究团队从实验日志中摘录了一些AI实际生成的洞见条目,这些内容直观地展示了这套机制在做什么。

在数学方向,一条从编号为math_hard_10的任务中提炼出的洞见这样描述:“计算某范围内能被多个数整除的整数数量时,需要将模运算约束整合进序列的结构定义中,而不是当作外部条件处理。这样才能准确建模那些模数影响递归或周期行为的序列。”另一条关于几何的洞见则强调,求梯形面积时识别平行边和精确测量垂直高度两步缺一不可,并提出了一套结构化的分析流程。

在编程方向,一条从竞赛题中提炼的洞见建议:当涉及数值范围和潜在溢出时,应当使用显式饱和的有界算术,把中间值限制在合法范围内。另一条建议:当符号计算验证数学逻辑可能有边界情况时,应在具体测试点上用数值计算进行交叉验证,以捕捉化简错误。

这些洞见的特点在于,它们都是可操作的、跨任务的模式总结,而非针对某道具体题目的提示。因此,它们能够被有效地迁移到后续的类似任务中,也能够被有意义地路由给在对应方向上有欠缺的AI。

九、这项研究的局限与下一步方向

研究团队也对框架的局限性进行了坦诚的说明。目前的测试只覆盖了两个模型家族,更多不同架构模型的验证需要在后续工作中补充。不过,由于整套机制完全通过提示词实现,不依赖任何特定的模型内部结构,理论上应当具备良好的可迁移性。

在计算成本方面,EVOCHAMBER大约需要单个AI 3.6倍的算力。但与使用5个AI进行多数投票的方案相比,它只需要后者72%的算力,同时准确率更高。这个权衡在很多实际场景下是合理的。

生命周期管理中的阈值参数目前是固定的,跨所有任务流统一使用。未来,通过元优化自动学习这些参数是一个有价值的研究方向。此外,运行更长的任务流(超过1000道题)将有助于观察专家化的长期稳定性、洞见过时与更新的机制,以及极难任务对框架性能上限的挑战。

更精细的团队贡献归因也是一个值得深入的问题。目前,系统将团队结果作为共享奖励分配给所有成员,但每个成员的实际贡献度,理论上可以被更精确地建模和量化。

说到底,这项研究试图回答的是一个最朴素的问题:如果你拥有一群AI,怎样才能让它们真正像一支越来越厉害的团队一样工作,而不是简单地把同一件事重复做N遍?答案在于,你需要让它们之间有真实的知识流动,有基于能力的分工协作,有随任务结构动态调整的团队构成,以及能够从经验中自发涌现的专家化分工。这些都不是预设好的,而是从简单的规则和持续的反馈中自发生长出来的。这个思路,为未来如何设计和部署多AI系统,提供了一个值得认真对待的参照框架。

Q&A

Q1:CODREAM机制是如何决定把知识传给哪个AI的?

A:CODREAM在团队失败或意见分歧时触发。经过五步反思流程提炼出结构化洞见后,系统会查看每个AI在该类任务上的近期表现评分,只将洞见写入那些表现低于团队中位数的AI。也就是说,强者产出知识,弱者接收知识,而不是均匀广播给所有人。这样既精准弥补了短板,又保留了专家的独特性和知识深度。

Q2:EVOCHAMBER在多数投票失效的困难任务上为什么能表现更好?

A:多数投票在单个AI成功率很低时,会主动覆盖掉少数的正确答案。EVOCHAMBER通过锚定者(由当前最强AI担任领导)根据历史经验智能选择协作结构来规避这个问题。在低成功率情境下,领导者会倾向于选择辩论、生成-评审或分解等结构,而不是简单的投票。这使得偶尔出现的正确思路有机会在讨论中被识别、辩护和保留,而不是被淹没在错误答案的海洋中。

Q3:EVOCHAMBER运行需要对AI模型重新训练吗?

A:不需要。EVOCHAMBER完全通过提示词(即给AI的文字指令)来实现所有机制,包括经验存储、团队组建、协作结构选择、洞见提炼和生命周期管理。所有AI知识的积累和传递都发生在上下文和外部记忆库层面,无需对底层模型的任何参数进行调整。因此,该框架可以直接应用于现有的各类AI模型之上。

本文转载于:https://www.163.com/dy/article/KTAT8K6P0511DTVV.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注