当前位置:

首页 > 硬件相关 > 中科院教会AI"从错误中学习":让大模型像人类一样会改错的新方法

中科院教会AI"从错误中学习":让大模型像人类一样会改错的新方法

中国科学院团队提出CIPO新方法,旨在改进大模型训练。传统方法仅判断答案对错,效率低下。CIPO则引导模型参考自身错误答案重新作答,从而从错误中学习并提升纠错能力。该方法无需外部标注,在数学推理和代码生成等任务上表现显著优于传统方法,有效利用了失败样本的价值。


想象一下,你正在教一个极其聪明但又有点固执的学生。他答对时,你给予奖励;他答错时,你只是简单地摇头说“不对”。问题是,如果你从不告诉他错在哪里、该如何改正,他真的能进步吗?

这正是当前大模型训练面临的一个核心困境。最近,中国科学院软件研究所中文信息处理实验室联合中国科学院大学和小红书公司的研究团队,在arXiv上发布了一项引人注目的研究(论文编号:arXiv:2605.14539v1)。他们提出了一种名为CIPO(Correction-Oriented Policy Optimization,以纠错为导向的策略优化)的新方法,旨在解决大模型训练中一个长期被忽视的问题:如何让模型从自己的错误中有效学习,而不是将失败样本简单地丢弃。

这项研究直指当下主流训练范式的痛点。目前,让大模型学会解决数学题或编写代码,主要依赖于一种称为“可验证奖励的强化学习”(RLVR)的技术。通俗地讲,就是模型给出答案,系统判断对错并给予奖励或惩罚。这听起来合理,但研究团队发现,这套机制效率低下,就像一个只会批改“对错”却从不讲解的严厉老师。CIPO的巧妙之处,就在于它让这位“老师”学会了利用“错题本”,引导模型在反思中成长。

一、那位只会说“对”或“错”的严厉老师,到底有什么问题?

主流的方法,例如知名的GRPO算法,采用的是一种“奖励-压制”模式:对的答案得到强化,错的答案被一概否定。这种粗放的方式至少带来三个显著问题。

首先是反馈信号过于模糊。一道题做错了,原因可能千差万别:或许是最后一步的计算失误,也可能是解题思路从一开始就南辕北辙。这两种错误的性质截然不同,但传统方法给予的惩罚信号却是一样的。这无异于老师对“考了59分”和“考了0分”的学生给予同样严厉的批评,显然无法提供有效的学习指导。

其次是信息资源的巨大浪费。一份错误的答案中,往往包含着大量正确的推理步骤和部分有效的思路。仅仅因为最终结论错误,就将整个解题过程全盘否定,无疑丢弃了宝贵的学习材料。

最后,这导致了训练效率的瓶颈。模型只能从成功的样本中学习,难以洞察自身的能力边界究竟在哪里,也就无法进行有针对性的突破。

当然,业界并非没有意识到这些问题。以往的尝试主要沿着两个方向:一是引入“过程监督”,即对每一步推理进行评判,但这成本高昂且可能引入新的噪声;二是构建“教师模型”来提供反馈,但这方法对反馈质量依赖极高,对能力较弱的模型效果不佳。研究团队因此思考,能否找到一种不依赖外部辅助、能够自给自足的解决方案?CIPO正是基于这一思路的产物。

二、CIPO的核心妙招:让AI给自己的错题写“反思笔记”

CIPO的核心思想异常简洁而深刻。当模型给出一个错误答案时,传统做法是直接打压这个输出。而CIPO则不同:它会将原始问题和这个错误答案一并呈现给模型,并发出一个新的指令:“这是你之前的解答,请参考它,重新尝试解决这个问题。”

这个简单的操作,瞬间将混沌的“错误”转化为了有信息量的“路标”。考虑两种典型错误:一种是“擦边球错误”,比如最后一步计算失误;另一种是“方向性错误”,即解题思路完全错误。当模型被要求“参考错误答案重做”时,对于前一种情况,它很可能轻松修正得到正确答案;对于后一种情况,则可能依然束手无策。这样一来,模型无需外部指导,就能自然地区分错误的严重程度。

更重要的是,这个过程顺便训练了模型一项至关重要的能力——纠错。在现实应用中,AI不仅需要从零开始生成内容,往往还需要审查、调试或修正已有的内容(如代码、推理链)。传统训练方法完全忽略了这项技能的培养,而CIPO则在训练解题能力的同时,自然而然地让模型练习了“识别错误并改正”的能力。

三、把这套方法变成现实:CIPO的具体操作流程

好的理念需要精巧的工程实现。研究团队设计了一套完整的训练流程,其核心是一个动态循环。

在每一轮训练中,模型首先像往常一样处理一批问题,产生一系列答案,构成“基础流”。接着,CIPO会从中筛选部分样本(尤其是错误样本),将问题和对应的错误答案拼接成新的提示,让模型基于此重新作答,形成“纠正流”。最终,模型同时从这两股数据流中学习:一股锻炼独立解题能力,另一股锻炼纠错反思能力。

然而,如果只是简单地将错题扔回去重做,可能会引发新的问题,例如模型过度关注错误而遗忘已有知识,或者在过于简单或困难的题目上无效重复。为此,研究团队引入了三个关键的调节机制。

第一个是“自适应回放比例”。CIPO并非固定混合成功与失败样本,而是根据模型的实时表现动态调整比例。如果模型近期表现稳健,则增加错题练习以寻求突破;如果出现能力倒退迹象,则立刻增加成功样本以巩固基础。这就像一个经验丰富的教练,根据运动员的状态灵活调整训练计划。

第二个是“风险规避型奖励塑造”。这个机制重点关注一种危险情况:模型面对一个原本正确的参考答案,却给出了错误答案。这被视为严重的能力退化信号,CIPO会对这种情况施加更严厉的惩罚。这种不对称的奖惩策略,有效防止了模型在探索新能力时丢失旧技能。

第三个是“难度感知偏好”。这个机制基于一个经典的教育学原理——最近发展区理论。训练效率最高的题目,是那些难度略高于模型当前水平、但通过努力可以解决的题目。CIPO会优先选择模型通过率在37.5%到75%之间的“挑战区”题目进行重点练习,确保每一次训练都用在刀刃上。

这三个装置共同作用,使得CIPO成为一个能够自我调节的智能学习系统,既能深度挖掘失败样本的价值,又能保障训练过程的稳定与高效。

四、实战检验:CIPO到底有多厉害?

任何方法的有效性都需要数据验证。研究团队在11个不同的测试基准上对CIPO进行了全面评估,覆盖数学推理和代码生成两大核心领域,结果令人印象深刻。

在数学推理方面,以Qwen3-4B模型为基础,在包括AIME24、AIME25、AMC23等六个高难度数学测试集上,CIPO将平均准确率提升至64.38%,相较于传统GRPO方法的59.83%,高出4.55个百分点。尤其在AIME这类竞赛级题目上,提升更为显著,证明了其处理复杂问题的能力。

在代码生成方面,使用Seed-Coder-8B模型在LiveCodeBench和LeetCode测试集上评估,CIPO同样领先。更值得关注的是训练动态:传统GRPO的表现很快会进入平台期并开始波动,而CIPO则能保持更稳定、持续的上升趋势。

为了证明CIPO是真正拓展了模型的能力边界,而非仅仅优化了输出策略,研究团队测试了“pass@K”指标(即给予模型K次尝试机会,至少成功一次的概率)。在AIME24上,CIPO的pass@32达到了86.67%,显著高于GRPO的76.67%。这强有力地说明,CIPO让模型具备了解决更难题目的潜力。

最惊人的表现或许在纠错能力上。在专门评估批评与纠错能力的CriticBench上,经CIPO训练的模型在数学纠错任务上的表现提升了7.74个百分点,远超GRPO。在DebugBench代码调试基准上,一个仅80亿参数的模型经过CIPO训练后,平均得分达到了64.99%,其性能不仅超越了参数规模大得多的Qwen2.5-72B模型,甚至与顶级商业模型Claude-Sonnet-4处于同一水平线。这展示了CIPO在效率上的巨大优势。

此外,研究还发现CIPO培养的纠错能力具有出色的“可迁移性”。仅在数学数据上训练的模型,其纠错能力可以泛化到常识推理、符号推理等未见过的领域,这说明它学会的是一种通用的“反思与修正”思维模式。

五、拆解每个零件:消融实验告诉我们什么?

严谨的研究需要证明每个设计环节都是必要的。通过一系列消融实验,研究团队逐一移除了CIPO的各个组件,观察性能变化。

移除“在线回放”机制(即不再动态使用当前产生的失败样本)后,性能下降了3.91个百分点。这证实了实时利用错误样本至关重要,因为模型在不同阶段会犯不同的错误。

将“自适应控制”改为固定比例混合后,性能下降了4.19个百分点,说明僵化的训练配方远不如灵活的策略有效。

影响最大的是移除“风险规避奖励塑造”。性能骤降6.97个百分点,这凸显了防止训练过程中能力倒退是维持稳定性的关键。

最后,移除“难度感知偏好”后,性能下降3.40个百分点,印证了针对“最近发展区”进行训练能显著提升学习效率。

这些实验结果表明,CIPO的各个组件相互协同,构成了一个有机整体,缺一不可。

六、这一切对我们意味着什么?

回过头看,CIPO研究的技术细节背后,蕴含着一个普适的学习哲学:如何将失败转化为进步的阶梯。

它将AI训练从简单的“是非奖惩”提升到了“反思性成长”的层面。那些曾被当作垃圾丢弃的失败样本,如今变成了最具价值的训练材料。模型不仅学会了答题,更学会了如何审查和修正,成为一个更全面的“思考者”。

对于普通用户而言,这项研究的远期意义在于,我们未来交互的AI助手可能会变得更善于理解和修正错误。当你指出它的回答存在问题时,它或许能更精准地定位问题所在并提供修正,而不是机械地重复或盲目尝试。

对于AI研究者与开发者而言,CIPO提供了一个重要的思路启示:在追逐更大规模的数据和更复杂的模型架构之前,或许应该首先审视,我们是否已经充分榨取了现有训练过程中产生的数据价值。模型自身产生的错误,恰恰是刻画其当前能力边界最精确的“地图”。

归根结底,CIPO的故事不仅关乎AI,也映照着人类学习的基本原理。它提醒我们,错误本身并不可怕,可怕的是对错误的忽视与浪费。从错误的具体位置出发,进行分析和修正,才是通向精通的必由之路。这项研究留给我们的,或许正是这样一个朴素而深刻的思考。

Q&A

Q1:CIPO方法和传统的GRPO相比,最大的不同是什么?

A:最根本的区别在于对待错误答案的方式。GRPO采取“压制”策略,仅告知答案错误。CIPO则采取“反思”策略,将错误答案作为输入的一部分,要求模型参考它重新作答。这使得模型能从错误中获得具体的修正方向,并同步习得纠错能力。形象地说,GRPO是只判对错的考官,CIPO则是引导学生分析错因的老师。

Q2:CIPO在哪些任务上效果最明显?

A:在需要严谨推理和纠错能力的任务上提升尤为显著。例如在数学竞赛题(如AIME)和代码生成与调试任务上。数据显示,在数学推理上平均准确率提升超过4.5个百分点;在代码调试任务上,小规模模型经CIPO训练后,性能可媲美甚至超越参数规模大一个数量级的模型。这体现了其在提升模型“反思”与“修正”本质能力方面的优势。

Q3:CIPO需要额外的人工标注或外部模型帮助吗?

A:完全不需要。这是CIPO方法的一大优势。它利用模型自身在训练中产生的失败样本作为学习材料,形成了一个自给自足的闭环学习系统。无需昂贵的人工过程标注,也无需额外训练一个“裁判”模型来提供反馈,极大地降低了部署成本和复杂性,使其更具实用性和可推广性。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。