当前位置:

首页 > 硬件相关 > 为什么让AI同时学多门课,反而会让它"偏科"越来越严重?

为什么让AI同时学多门课,反而会让它"偏科"越来越严重?

上海人工智能实验室研究发现,AI在多任务训练中因熵差异导致激励信号不均衡,形成偏科恶性循环。提出的组熵控制策略优化(GEPO)通过自适应阈值调整不同任务训练信号,在十三个测试中综合表现优于现有方法。

这项研究由上海人工智能实验室主导,2026年7月以预印本形式发表在arXiv上,编号为arXiv:2607.16850v1。想深入了解的读者,可以直接拿这个编号去搜,完整论文都在那儿。

一、一个让AI研究者头疼的老问题

假设你是个私人教练,带着五个学员:一个想练长跑耐力,一个想练举重爆发力,一个想练瑜伽柔韧性,一个想练拳击速度,一个想练游泳协调性。如果你给所有人一模一样的训练计划,结果会怎样?举重运动员可能练得风生水起,但瑜伽学员会因为太多力量训练而受伤;长跑学员进步飞速,可游泳学员几乎没机会下水。每个人的需求完全不同,却用同一套方案对待,到头来强者越强、弱者越弱。

现代大型语言模型——也就是像ChatGPT、DeepSeek这类AI系统——的训练,恰恰面临同样的难题。这些AI不是只学一件事,它们需要同时学会数学推理、物理解题、写代码、回答科学问题、理解指令……每一类任务对AI来说,难度和特性都截然不同。上海AI实验室的研究团队发现,现有的AI训练方法在处理这种“多科目同时学习”时,存在一个根本性的隐患:它们让AI越来越偏科,而且这个偏科的趋势会随着训练不断自我强化。

这项研究的核心贡献,是找到了偏科现象背后的真正元凶,并提出了一个解决方案——“组熵控制策略优化”(Group Entropy-Controlled Policy Optimization,简称GEPO)。在十三个不同类型的测试项目上,这套方法的综合表现超过了目前主流的所有同类方法。

二、“熵”:AI的一个重要体温计

在正式讲解这个研究之前,得先理解一个关键概念——“熵”。这个词听起来很物理学,但可以用一个非常直观的比喻来理解。

把AI回答一道题的过程,想象成一个人面对路口做选择。当这个人对路非常熟悉,他几乎不用思考,直接走上最常走的那条——这就是“低熵”状态,也就是说AI非常确定自己要给出什么答案,它的选择空间很窄,几乎每次都走同一条路。相反,当这个人对路完全陌生,每个路口都可能选左也可能选右,每次走出的路线都不一样——这就是“高熵”状态,AI非常不确定,它的答案每次都可能大相径庭。

在AI的强化学习训练中,熵是衡量AI“探索程度”的晴雨表。高熵意味着AI还在积极探索各种可能的答案路径,这对难题来说是健康的;低熵意味着AI已经倾向于集中在某几个固定的回答上,对已经基本掌握的简单题来说是好事,但如果来得太早,就意味着AI过早地锁死了一种思路,放弃了探索其他可能更好的解题方法。

研究团队通过实验观察到了一个非常有趣的现象:在同一个正在训练的AI模型下,不同类型的题目会触发截然不同的熵水平。具体来说,物理题的平均熵值约为0.49,数学题约为0.60,而指令遵循类任务(比如“请用正式语气改写这段话”)的熵值高达0.78。这就好比同一个学生,做选择题时思路很清晰(低熵),做作文时思绪万千、下笔困难(高熵)——这完全正常,因为题目本身的性质就不同。

三、现有方法的盲点:用同一把尺子量不同的事

现在主流的AI训练算法,在处理熵的问题上,大致分两个层次,但两者都有根本性的局限。

第一类是“全局熵控制”,把整个模型当作一个整体,计算出一个平均熵值,然后统一调整。这就像用全班同学的平均身高来决定食堂餐桌的高度——平均值掩盖了个体差异,高个子要弯腰,矮个子够不着。当AI同时学习物理和指令遵循时,一个任务的熵已经很低了,另一个还很高,取平均之后得到一个中间值,对谁都不合适。

第二类是“词元级熵控制”,粒度更细,细化到AI生成每一个字词时的不确定性。这虽然比全局方法更精细,但仍然没有解决根本问题:它只看到了单个字词的不确定性,却没有把不同任务类型之间的差异考虑进去。

在这两类方法之外,还有一个更严重的问题几乎被所有人忽视了。现有最流行的AI训练算法之一叫GRPO(组相对策略优化),它的核心做法是:让AI对同一道题生成多个不同的答案,然后根据这些答案的好坏打分,再把分数“标准化”——也就是把每道题的分数转换成相对排名,高于平均分的答案得到正向激励,低于平均分的答案得到负向惩罚。

这个标准化操作本来是为了让不同题目的激励信号可以相互比较。但研究团队发现,这个假设在不同题目的熵差异很大时根本不成立。

四、偏科的恶性循环是怎么形成的

为了说清楚这个问题,需要从GRPO的激励机制说起。

当AI在某道题上得分的标准差很小(也就是所有答案质量差不多),标准化之后每个答案的激励信号都很弱,AI不会得到太强烈的“你做对了”或“你做错了”的信号。而当某道题上所有答案质量差异很大(比如大多数都错、偶尔一个对),正确答案得到的激励信号就会非常强烈,错误答案受到的惩罚则很分散、很轻微。

研究团队推导出了一个精确的数学关系:假设某道题上AI答对的概率是p,那么正确答案得到的激励强度是√((1-p)/p),错误答案受到的惩罚强度是√(p/(1-p))。当p很小(比如p=0.16,也就是只有16%的答案是对的),正确答案的激励强度会爆炸性地增大,而错误答案的惩罚则非常微弱。这就造成了一种极度扭曲的训练信号。

而这种扭曲,恰恰在高熵任务(如指令遵循)上最为严重,因为高熵任务往往对应着更低的正确率。研究团队在真实训练数据上验证了这一点:物理题(低熵)的优势分布接近对称;数学题(中等熵)呈现轻微的右偏斜;而指令遵循任务(高熵)的偏斜值高达2.32、峰度高达4.84,分布极度扭曲——绝大多数答案都只得到很小的负面信号,而极少数正确答案却得到了极端强烈的正向信号。

更糟糕的是,不同任务之间的标准化分数根本不处于同一参考系下。研究团队用两个命题严格证明了这一点:首先,当AI的熵越低,它的选择分布与“均匀分布”(也就是随机乱选)的偏差越大,这意味着低熵任务的分数分布被策略本身严重扭曲;其次,这种扭曲直接导致标准化之后的激励信号,在低熵任务上系统性地偏离了真实的奖励排名,而在高熵任务上则偏差较小。

这两个效应叠加在一起,创造出了一个令人担忧的循环:低熵任务(AI已经学得比较好的任务)产生了最强烈、最一致的训练梯度,进一步加强了AI在这些任务上的能力;而高熵任务(AI还需要更多探索的任务)产生了弱小、嘈杂的训练信号,学习效率越来越低。随着低熵任务越做越好,它的熵进一步降低,与高熵任务的差距越来越大,高熵任务受到的有效训练越来越少。偏科的剪刀就这样越张越大。

五、GEPO的解法:给每道题定制一把专属体温计

面对这个问题,上海AI实验室的团队提出的方案,核心思路是:不再用一把全局的尺子量所有任务,而是给每一组题目单独量一次体温,然后根据这个体温做出针对性的调整。

具体来说,GEPO的第一步是计算“组熵”。在GRPO的训练过程中,AI本来就需要对同一道题生成多个答案(通常是16个),GEPO利用这些已有的答案,直接计算这一组答案的平均熵值,把它称为该题目的“组熵”。这个计算完全免费,不需要额外生成任何答案,因为答案已经在那里了。为了让不同长度的答案之间可以公平比较,还会把总熵值除以平均答案长度,得到“每个词的熵”。

得到组熵之后,GEPO做的第二步是根据体温施加定制化的干预。具体规则如下:对于组熵很低的题目(AI已经非常确定,说明快要“固化”了),如果这道题里出现了答对的答案,就把给这个答案的正向激励适当削弱一点,避免AI在已经学得够好的方向上继续过度强化,防止它过早地锁死思路。对于组熵很高的题目(AI还在大量探索,说明这类任务还没学好),如果出现了答错的答案,就把给这个答案的负向惩罚适当减轻一点,避免AI还没来得及探索出好的解题路径,就因为大量的惩罚信号而放弃了探索。

这个干预是不对称的,也就是说,减轻低熵任务的正向激励,和减轻高熵任务的负向惩罚,用的是不同的力度。研究团队发现,低熵任务对干预更敏感:如果在低熵任务上过于激进地惩罚错误答案,会导致AI为了降低每个词的不确定性而快速缩短回答长度——这是一种病态行为,叫做“长度崩塌”,表现为AI开始给出越来越简短甚至空洞的回答。因此,对低熵任务的干预要温柔,对高熵任务的干预可以更大胆。在实验中,对低熵任务的正向激励缩减系数设为0.5,对高熵任务的负向惩罚缩减系数设为0.2。

第三步是自适应阈值。怎么判断一道题的组熵是“低”还是“高”?这个标准不能固定死,因为不同的基础模型、不同的训练阶段,熵的绝对数值差异很大。GEPO的解决方案是:每一轮训练时,计算当前这一批题目的平均熵值和标准差,然后把“均值减去0.2个标准差”定义为低熵阈值,把“均值加上0.3个标准差”定义为高熵阈值。组熵低于低熵阈值的题目就触发低熵干预,高于高熵阈值的题目就触发高熵干预,介于两者之间的题目则完全保持原样,不做任何调整。

为了防止这个阈值因为某一批数据的偶然波动而剧烈跳动,GEPO还用了指数移动平均的方式把阈值平滑化——简单理解就是,新计算出的阈值只占10%的权重,历史积累的阈值占90%的权重(平滑系数γ=0.01),这样阈值会随着训练进展缓慢稳定地变化,不会因为某一批特别难或特别简单的题目而急剧波动。

六、实验结果:在十三个考场上的成绩单

研究团队用两个不同的基础模型来测试GEPO的效果,分别是Intern-S1-mini(一个轻量级多模态推理模型)和Qwen3.5-9B(一个纯文本推理模型)。测试覆盖了十三个不同的基准测试,包括数学竞赛(AIME2025、IMO-Bench)、数学视觉理解(MathVista)、物理推理(Physics、CMPhysBench)、指令遵循(IFBench)、代码生成(LiveCodeBench)、综合知识(MMLU-Pro、GPQA)、多模态理解(MMMU-Pro)、科学推理(SFE、MicroVQA)和图表理解(ChartQAPro)。

对比的基准方法包括:原始的GRPO算法、AEPO(一种基于熵的改进方法)、Clip-Cov和KL-Cov(两种基于概率协方差的覆盖率感知方法)。

在Intern-S1-mini上,GEPO在十三个测试中的七个上取得了最好成绩,综合平均分达到54.2,而GRPO、Clip-Cov、KL-Cov分别是51.5、51.5、51.8。AEPO在数学上表现不错,但在物理和指令遵循上表现欠佳,综合同样是51.8。尤其值得关注的是GEPO在数学竞赛类题目上的表现:AIME25从74.6提升到82.0,IMO-Bench从42.3提升到52.8,GPQA从65.1提升到69.2——这些都是极具挑战性的题目,提升幅度相当显著。

在Qwen3.5-9B上,GEPO的综合平均分达到71.2,高于GRPO的70.7、Clip-Cov的70.9和KL-Cov的69.9。AEPO在这个模型上表现大幅倒退,综合仅67.1,甚至不如原始的GRPO,这说明AEPO的固定熵控制策略对不同模型的适应性很差——当模型的熵特性发生变化时,AEPO的表现会出现明显下滑。GEPO的自适应阈值机制则无需任何调整就能自动适配新模型。

训练过程的稳定性差异同样引人注目。在Qwen3.5-9B的训练过程中,原始GRPO在训练到约170步时发生了灾难性崩溃,AIME25的准确率从约85%骤降至约40%,同时GPQA、MMMU-Pro、MathVista也同步大幅下滑。这是失控的熵增长导致的:没有任务感知的熵调节,模型的输出熵可以无限制地增长,最终产生混乱无意义的输出。AEPO虽然避免了完全崩溃,但表现出持续的震荡,始终无法稳定收敛。KL-Cov在同一模型上于100步后也发生了训练崩溃,推测原因是它使用了固定的熵阈值,无法适应不同任务的需求。GEPO则全程平稳上升,从未出现任何崩塌迹象。

通过观察不同任务的熵随训练步数的演变,可以更清楚地看到GEPO和AEPO的本质区别。AEPO会把所有任务的熵强行拉向相似的水平,抹平了不同任务之间本来应该存在的差异——这就像那位私人教练给所有学员制定了完全相同的训练量,不管你是举重还是瑜伽。GEPO则恰恰相反,它保留了不同任务之间的熵差异:需要更多探索的任务维持在较高的熵水平,而已经基本掌握的任务则自然降低到较低的熵水平,形成了一个健康的、因任务而异的“学习节奏”。

七、拆开来看,每个零件都不可缺少

研究团队还通过消融实验(也就是逐一去掉某个功能,看看成绩有什么变化)验证了GEPO各个组成部分的贡献。

去掉高熵控制(即不再减轻高熵任务的负向惩罚)时,综合成绩从54.2下降到51.3,下降幅度最大。这说明高熵控制是GEPO最关键的组件——如果不保护高熵任务的探索空间,AI会在高熵任务上因为大量惩罚信号而过早放弃探索,物理和AIME25这类需要深度推理的任务受损最严重。

去掉低熵控制(即不再减弱低熵任务的正向激励)时,综合成绩下降到52.6。低熵控制的主要作用是防止AI在已经学好的方向上过度强化,保持探索多样性,主要对IMO-Bench和指令遵循任务的贡献更为突出。

去掉不对称设计(把两个缩减系数设置为相同值)时,综合成绩下降到53.0。这说明区分对待两种熵状态、用不同力度进行干预,确实比一刀切的对称处理更有效。这个发现呼应了之前关于低熵任务对激进干预更敏感的分析:温柔对待低熵任务、大胆对待高熵任务,是符合各自特性的设计。

归根结底,这个研究讲述的是一个关于“因材施教”的故事。AI在同时学习多种不同性质的任务时,不同任务处于完全不同的学习阶段和探索状态,如果用统一的方式对待它们,强的会越来越强、弱的会越来越弱,最终形成一种高效率但高度偏科的AI。GEPO的方案是给每一组题目独立测量“探索体温”,然后针对性地调整训练信号——已经学得很扎实的任务,稍微踩一踩油门,别让它抢占太多资源;还需要大量探索的任务,少用点刹车,给它更多空间去寻找正确路径。这种调整既不需要提前告诉AI哪些题是哪类任务,也不需要额外生成任何答案,成本几乎为零。

这对普通用户而言意味着什么?这项研究直接影响的是AI大模型的后训练质量。一个通过GEPO训练的AI,在回答你的数学问题和写作需求时,能做到更均衡:不会因为数学题“比较好训练”而把大量精力都投入数学,忽视了你的写作或代码需求。更重要的是,训练过程更稳定,意味着研究机构和企业在训练AI时的失败风险降低了,最终产出的模型质量更可靠。

有意深入了解技术细节的读者,可以通过arXiv编号2607.16850检索完整论文,作者来自上海人工智能实验室,论文包含完整的数学推导和实验细节。

Q&A

Q1:GRPO训练中为什么不同任务的激励信号会产生系统性的不平衡?

A:GRPO通过对同一道题的多个答案进行标准化处理来构建激励信号,但这种标准化隐含着一个前提:不同题目的激励信号在同一参考框架下可以相互比较。然而当不同任务的熵差异很大时,标准化后的分数分布本身就受到策略分布的扭曲,低熵任务产生的激励信号更强烈、更一致,高熵任务产生的信号更弱小、更嘈杂,导致训练资源被低熵任务系统性地抢占。

Q2:GEPO的自适应熵阈值和固定阈值相比有什么优势?

A:固定阈值在不同基础模型或训练阶段之间无法适应,因为不同模型的熵绝对数值差异很大,同一个固定阈值对某个模型可能合适,对另一个模型可能完全失效。GEPO的阈值基于当前批次的熵均值和标准差动态计算,并通过指数移动平均平滑,能自动跟随训练进展和模型特性调整,无需针对每个模型单独调参。

Q3:GEPO需要额外的计算开销或额外的数据标注吗?

A:GEPO不需要任何额外的计算开销,也不需要任何任务类型的标注信息。组熵的计算完全基于GRPO训练过程中已有的答案样本,属于零成本的“顺手”操作。整个方法作为GRPO的轻量扩展,可以直接集成到现有的基于分组的策略优化框架中,不改变采样流程,不增加模型参数。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。