发布于2026-08-21 阅读(0)
扫一扫,手机访问
这项由清华大学、浙江大学、香港中文大学、南洋理工大学以及同济大学共同参与的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2606.26790。
训练一个会"举一反三"的AI,比你想象的难得多
假设场景是这样:你正在培训一个新来的快递员。每天跑完线之后,你只告诉他一句"今天的包裹送到了"或者"没送到",但从头到尾不告诉他哪个路口拐错了、哪次敲门方式不对导致没人应。这种"只给最终成绩、不给过程点评"的带法,效率可想而知——快递员只知道这一趟是成功还是失败了,但具体错在哪、该怎么改,全靠自己悟。下次大概率还会在同一个坑里翻车。
眼下的AI智能体训练,面临的就是几乎一模一样的困局。研究人员用强化学习来训练AI完成复杂任务,比如在虚拟家居环境里整理物品、去电商平台搜商品下单、或者借助搜索引擎回答问题。这类任务要求AI连续做出十几步甚至几十步的决策,但训练时唯一的反馈只有最终那个"成功"或"失败"的信号——完成了得1分,没完成得0分。中间那几十个决策步骤,哪步做对、哪步做错,没有半点提示,全靠AI自行摸索。
这种"只看结果不看过程"的训练模式,学名叫"基于结果的强化学习",最典型的方法就是GRPO(一种无需额外评估模型的策略优化算法)。好处是稳定可靠,坏处也摆在那里:就像那位只拿到最终成绩单的快递员,AI很难从稀疏的奖励信号里学会精细的决策技巧。尤其在需要连续执行多步的长程任务中,一个早期的小错误往往要等到很多步之后才暴露后果,让AI几乎无法追溯归因——追责都找不到源头,更别提改进了。
正是在这个节骨眼上,研究团队拿出了OPID(On-Policy Skill Distillation,在线策略技能蒸馏)。这个框架的核心思路,是把AI自己跑过的每一段完整经历——不管最终是成功还是失败——都当成一本可以反复翻阅的"经验手册",从中提取出具体的行为智慧,再反哺给训练过程。这样一来,每次尝试都能产生远比单纯"成功/失败"更丰富的学习信号。
要真正理解OPID解决的是什么问题,不妨用另一个更贴近生活的例子来感受一下这种难度。
假设一个围棋新手在跟教练学棋。每盘棋收掉之后,教练只来一句"这局你输了",却不说第15手那步关键落子直接导致了全局崩盘,也不提第30手本来有一个翻盘的妙招。没有这两条关键反馈,新手要想提升棋力,就只能拼命加练,指望靠大量重复对局慢慢悟出门道。这个过程有多慢、多痛苦,相信所有学过竞技的人都有体会。
AI智能体面临的处境,比这还要糟糕。因为它要完成的任务里,一条完整轨迹动辄包含二三十个连续决策步骤,每个步骤都需要AI根据当前状态做出判断。最终的奖励信号就一个,要分摊到几十个步骤上,分到每一步头上,饼就那么一丁点儿大。
更让人头疼的是,有些错误天然带有"延迟爆炸"的特性——AI在第5步拿错了物品,但一直到第25步它才发现自己手里那东西根本不是任务要求的。结果就是,20步白走了。这种延迟因果关系,靠单纯的成功/失败信号几乎不可能被AI理解——因果链条隔得太远。
这期间,学术界也不是没想过其他办法。有的方法叫"技能条件化自蒸馏",思路是给AI的"教师分身"额外提供自然语言写成的行为经验描述(也就是"技能"),让教师分身在这些经验指引下对一个动作给出更精准的评分,然后学生分身再照着学。问题在于,这类方法有个共同的短板:技能描述来自外部的知识库或检索系统,维护这个库本身就费时费力,更要命的是,检索出来的技能描述往往是"理论上应该怎么做",跟AI正在面对的具体场景经常对不上号——这就像给一个在小巷里迷路的快递员塞一本写着"大街上最优行驶路线"的导航手册,看了等于白看。
OPID的出发点就是彻底绕开这个坑:不依赖外部检索,而是从AI自己刚刚跑完的轨迹里直接提取经验。这样一来,每一条训练信号都与AI当前的状态分布高度吻合。
理解OPID的运作逻辑,可以用"即时复盘"来类比。
想象一下,有位足球教练有个独门秘籍:每场比赛结束后,他立刻把球员叫到一起复盘。他不光总结整场的战术得失(比如"今天我们的高位逼抢很奏效"或者"定位球防守连续出现了同一个漏洞"),还会专门标出比赛中的两三个关键转折时刻,逐一分析那些节点球员应该做什么不同的选择。最后,他会把这些经验转化成球员在下一场比赛前就能内化的战术意识,而不是写成一本厚厚的战术手册让球员在场上一边跑一边翻。
OPID的做法跟这位教练如出一辙,整个流程可以分为三个紧密衔接的阶段。
第一阶段:从已完成的轨迹中提取层级化的"技能"。OPID让AI按照当前策略跑完一批完整任务,每条任务都输出一条完整轨迹——包括其间所有的观察、决策和最终结果。随后,一个基于大语言模型的"分析器"会扫读每一条轨迹,提炼出两个层次的经验描述。
第一层叫"情节级技能",相当于教练在全场复盘时的总结。对于成功完成的任务,这套描述记录的是有效的整体流程,比如"先定位目标物品,再去清洗站清洗,最后放到指定位置";对于失败的任务,则提炼出应该规避的错误模式,比如"不要在未确认物品是否干净的情况下直接将其放入目标位置,重复移动同一物品而不执行清洗步骤是主要警示信号"。这类技能比较宏观稳定,适合作为大多数决策步骤的基础指导。
第二层叫"步骤级技能",好比教练对比赛中那一两个关键转折时刻的专项分析。分析器会在整条轨迹中找出少数几个"关键时间步"——那些对最终结果影响最大的决策节点。比如"第2步,应该直接去看储物台,而不是先检查库存",或者"第4步,应该立刻前往水槽清洗,而不是先探索其他房间"。步骤级技能高度具体、指向明确,但只针对那几个真正关键的决策节点。
根据实验数据,在整个训练过程中,每条轨迹平均只被识别出大约3到4个关键时间步,远少于总步骤数。这说明OPID提供的步骤级监督是高度选择性的,并不是对每一步都进行密集干预。
两类技能都提炼出来了,接下来OPID面对一个实际的问题:在执行轨迹的每一步,到底该用哪一类技能来做指导?
研究团队设计了一个"关键优先路由"机制,逻辑相当直接。对于被分析器标记为关键时间步的那几个节点,系统会把对应的步骤级技能注入进去——这几个节点需要最精准的局部决策引导。而对于其他所有的"普通"时间步,系统则使用情节级技能作为默认的全局背景指导,提供一个宏观的行为框架。
这个设计背后的直觉其实很朴素:情节级技能像是递给快递员一张城市地图,告诉他走哪条路线最省时间;步骤级技能则像在图上的几个特别复杂的路口专门安排了一个向导,在最容易走错的地方给出精确指引。大多数路段有地图就够了,但在几个关键路口,光靠地图不行,需要更精确的现场指导。如果两类技能不加区分地叠在每一步上,反而会引起信息干扰。这一点,论文里的消融实验已经验证了:去掉路由机制、在所有步骤同时叠加两类技能,性能比有路由机制的版本下降了将近7个百分点。
确定了每一步该用哪类技能之后,OPID需要把这些技能实实在在转化成对训练有用的信号。这一步是整套框架最精巧的地方。
具体操作如下:系统把选定的技能描述插入到AI的交互历史里,形成一个"技能增强版历史记录"。接着,系统用训练刚开始时那个版本的AI策略,分别计算同一个实际生成的回应在"原始历史"和"技能增强历史"两种语境下被预测的概率。
如果某个词元(可以简单理解成句子里的一个词或词片段)在技能增强版语境下被预测的概率更高,说明这个词的选择符合技能所描述的经验,值得被强化;反过来,如果概率反而更低,说明这个词的选择与技能经验相悖,应该被压制。这个概率差值,就是所谓的"技能优势"——一个逐词级别的密集信号,不是整条轨迹共享同一个值。
最终,OPID把这个逐词的技能优势,与传统GRPO框架提供的基于结果的情节优势叠加在一起,形成综合训练信号。原来那位只有最终成绩单的快递员,现在每一步都能收到来自自己刚刚那次经历提炼出的具体反馈,训练效率自然蹭蹭往上走。
从理论层面看,研究团队还证明了这套技能损失函数在数学上等价于一种"相对KL散度"——简单说,就是它既推动AI的决策概率朝技能描述的方向靠拢,又不会让AI的行为飘离原来策略太远,学习效率和训练稳定性都有了保障。
另一个设计亮点是:这套分析器、技能提取和技能注入的流程,只在训练阶段启用。训练一旦结束,AI在实际执行任务时,完全不需要调用任何分析器或检索任何技能描述,仅凭训练中内化的能力独立行动。推理阶段没有额外计算开销,也避免了"训练时有技能指导、测试时没有"的表现落差。
研究团队在三个有代表性的智能体任务基准上进行了系统性评估,每个基准都代表了不同场景下的长程决策挑战。
第一个是ALFWorld,一个文字版的虚拟家居环境。AI需要完成类似"找到一个锅铲,清洗后放到餐桌上"的任务,通过文字指令与环境交互,最多允许连续30步操作。任务细分为六种类型:拿取、查看、清洗、加热、冷却和双物品拿取。
第二个是WebShop,模拟在电商平台上购物。AI需要根据自然语言描述的需求,通过搜索、浏览商品页面、选择属性、最终下单来完成任务,评分指标包括匹配度得分和完全成功率两项。
第三个是Search-based QA,一个搜索增强的问答场景。AI需要通过与搜索引擎交互来回答问题,涵盖七个不同的问答数据集,从简单事实题到多跳推理题,难度不一。
实验在三个不同规模的模型上进行:Qwen2.5-3B(约30亿参数)、Qwen2.5-7B(约70亿参数)和Qwen3-1.7B(约17亿参数),覆盖了小、中、大不同量级,确保结论的普适性。
整体结果相当直观:在ALFWorld和WebShop上,OPID在所有基线方法面前都占优;在搜索问答任务上也保持着强劲的竞争力。拿Qwen2.5-3B来说,OPID在ALFWorld上的平均成功率达到84.3%,相比纯结果导向的GRPO方法的75.0%,一口气拉升了超过9个百分点;在WebShop上成功率达到74.2%,比GRPO的63.3%高出近11个百分点;在搜索问答上的平均准确率达到45.0%,比GRPO的36.4%高出8.6个百分点。
对于参数量最小的Qwen3-1.7B模型,提升效果尤为突出。这个小模型在WebShop上的成功率从纯强化学习的38.3%跃升到64.8%,提升幅度超过了26个百分点。这背后的道理其实不复杂:小模型自身储备的行为经验本来就不多,来自轨迹的额外指导信号对它们来说价值更高,好比给一个刚开始学棋的孩子配上一位现场解说,效果自然远超自悟。
除了与纯结果导向的GRPO对比,研究团队还与多个引入了技能或自蒸馏机制的强化学习方法进行了横向比较,包括Skill-GRPO(训练时提供技能描述的GRPO变体)、Skill-SD(技能条件化自蒸馏)、RLSD(用技能信号调节各步骤更新幅度)以及SDAR(结合了强化学习与自蒸馏的综合方法)。
其中有一组对比特别能说明问题。Skill-GRPO这个方法在训练时给AI提供了来自外部的技能描述,但在测试时把技能描述撤掉了。结果在ALFWorld上,三个模型的成功率比纯GRPO分别下降了14.8、11.7和25个百分点——训练时靠着技能这根"拐杖"走路,测试时拐杖一撤就摔了,说明这些技能根本没能真正内化到模型参数里。OPID在测试时同样不用任何技能描述,成绩却比这些依赖外部技能的方法高出20到37个百分点,这有力地证明,OPID确实做到了把轨迹经验"内化"而非"依赖"。
即便对标测试时保留技能描述的Skill-GRPO*版本(也就是训练和测试都有技能辅助),OPID在ALFWorld和搜索问答任务上的两个Qwen2.5模型规格中仍然全面领先,进一步验证了从在线轨迹中提取的、分布匹配技能的独特价值。
研究团队还仔细跟踪了训练过程中AI行为的变化趋势,结果很有意思。在ALFWorld的训练曲线上,OPID和GRPO在最初阶段进步速度差不多,但到了中间阶段,OPID开始明显拉开差距,并一路保持领先直到训练结束。这种"中期分化"的现象提示,技能指导的真正价值是在AI初步掌握了基本任务结构之后才凸显出来的——这时候,细粒度的决策指导才能发挥最大的作用。
更值得关注的是效率层面的表现。OPID训练出来的AI不仅胜率更高,完成任务的步数也更少——OPID智能体平均需要15到16步,而GRPO智能体则需要17到18步。步数减少意味着AI学会了更直接有效的行动序列,无效探索和重复动作显著减少。
在数据利用效率上,实验显示只用60%的训练数据,OPID就能达到GRPO用100%数据训练时的水平;用80%的数据,OPID已经明显超越了GRPO的满数据结果。在各个数据规模下,OPID的绝对优势在9到20个百分点之间,低数据区间优势反而更大。这说明技能监督的核心价值在于从有限的轨迹中提取更多信息,而不只是在数据充裕时锦上添花。
为了验证AI学到的是可迁移的行为智慧,而非单纯记住了训练场景,研究团队专门在ALFWorld的"未见分割"测试集上评了OPID——也就是在训练中从未出现过的环境配置上进行测试。
结果显示,OPID在未见环境上的平均成功率达到78.6%,比GRPO的70.9%高出7.7个百分点。其中提升最明显的是"查看"类任务(提升了26.7个百分点)和"加热"类任务(提升了18.5个百分点),其他类型任务也保持了竞争力。因为技能在训练结束后已经完全融入模型参数,这种在陌生环境下仍然保持的优势,确实表明OPID帮助AI内化了可复用的行为结构,而非简单记住了特定场景与动作之间的映射关系。
研究团队还提供了一个具体的轨迹对比案例,生动地展示了OPID和纯GRPO训练出来的AI在实际行为上的差距。
任务很简单:"清洗一把铲子并放到餐桌上"。
用GRPO训练的AI从第1步就开始出问题了。它先查看库存,然后在餐台上找到铲子并取走,看起来一切正常。但到第10步,AI转向水槽,却突然对水槽里的一把勺子产生了兴趣,拿起了勺子。接下来的十多步,它花在清洗勺子上,然后把勺子放到餐桌,就认为自己完成了任务。整条轨迹中,AI始终还拿着那把铲子,但某个中间步骤突然发生了"目标替换"——用勺子代替了铲子,最终在30步耗尽前也没完成真正的任务,只能宣告失败。这种"走神"行为,恰恰反映了在缺乏精细步骤级监督的情况下,AI在长程任务中容易混淆目标、偏离方向。
用OPID训练的AI则展现了完全不同的行为模式。第1步直接走向餐桌确认铲子的位置,第2步取走铲子,第3步走向水槽,第4步执行清洗,第5步返回餐桌,第6步完成放置——6步干干净净地完成了任务。每一步的推理都紧扣任务目标,没有一丁点儿无效动作或目标混淆。这种"定位-清洗-放置"的流程,正是情节级技能所描述的全局工作模式;而每个关键决策节点上的精准行动,则体现了步骤级技能内化的效果。
说到底,OPID做的事情,就是把"吃一堑长一智"这个人类学习中最朴素的智慧,用一套严谨的技术框架实现在了AI的训练过程中。它不仅告诉AI"这次做得对不对",更从它自己走过的每段经历里提炼出"下次怎么做更好"的具体指导——而且这些指导与AI所处的当前状态高度匹配,根本不存在"书本知识与实际脱节"的老问题。
训练结束之后,AI把这些经验完全内化,实际执行任务时不需要任何外部支持,就能展现出更高效、更稳健的行为表现。这对于AI智能体在实际场景中的部署具有相当实质性的价值——毕竟,在真实应用环境里,你很难保证总有一个现成的知识库能随时被调用。
对于那些关心AI智能体训练方向的读者,这项研究提出了一个很值得琢磨的问题:在人类的学习成长过程中,"复盘自己的经历"和"向外界寻求指导"这两种方式,各自应该用在哪里、怎么结合?AI的训练方法,是不是该更多地朝着人类这种自我反思式的学习机制去靠拢?相关的技术细节,可以通过arXiv编号2606.26790找到完整论文。
Q1:OPID训练出来的AI在执行任务时还需要额外的技能描述支持吗?
A:不需要。OPID框架中的技能提取和技能注入流程只在训练阶段使用,训练结束后这些经验已经融入AI的模型参数中。执行任务时,AI完全依靠自身已内化的能力行动,不需要调用任何分析器、检索任何技能文件或接受任何外部提示,这也是OPID相比依赖外部知识库的方法的一个重要优势。
Q2:OPID中的"情节级技能"和"步骤级技能"有什么具体区别?
A:情节级技能是对整条任务轨迹的宏观总结,成功轨迹提炼的是可复用的全局工作流程,失败轨迹提炼的是应该避免的错误模式;步骤级技能则是针对轨迹中少数几个关键决策节点的具体行动指导,更精准但也更局部。OPID通过关键优先路由机制,在关键节点使用步骤级技能,其余节点使用情节级技能作为默认指导。
Q3:OPID在小模型上的提升效果为什么比大模型更显著?
A:参数量较小的模型(如Qwen3-1.7B)自身储备的行为经验和泛化能力相对有限,在面对复杂长程任务时更容易因缺乏精细指导而走弯路。OPID提供的来自在线轨迹的密集技能监督,恰好弥补了小模型在行为智慧上的短板,因此提升空间更大。以WebShop任务为例,OPID让Qwen3-1.7B的成功率从38.3%提升至64.8%,提升幅度超过26个百分点。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9