商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 清华陶建华团队提出「自进化同策略蒸馏」SEED:让Agentic RL训练也懂事后监督

清华陶建华团队提出「自进化同策略蒸馏」SEED:让Agentic RL训练也懂事后监督

  发布于2026-08-01 阅读(0)

扫一扫,手机访问

交互式Agent在长程任务中频繁“翻车”,已经是老生常谈的问题了。一个很自然的想法是:能不能让它们像人类一样,学会“事后复盘”,从成功和失败的经历中提炼出可复用的经验?

强化学习(RL)如今已是后训练阶段的主流范式,但在长程Agent任务中,基于结果的RL有一个明显的“监督缺口”——它只看最终结果,看不见过程中那些有价值的细节。比如,一条失败轨迹里可能藏着有效的动作序列,而一条成功路径上也未必所有步骤都值得推崇。到底哪些中间观察、哪些工具调用才真正值得被强化?这恰恰是当前方法难以回答的问题。

针对这个痛点,清华大学自动化系陶建华团队及其合作者提出了一套名为“自进化同策略框架”(SEED)的解决方案。核心思路很直接:把当前策略已经完成的轨迹,转化为训练时的事后(hindsight)技能,再将这些技能的行为效果蒸馏回策略模型本身。

论文链接:https://arxiv.org/abs/2607.14777

效果怎么样呢?在基于文本和基于视觉的智能体任务上,SEED不仅持续提升了性能和样本效率,还展现出了对未见场景的鲁棒泛化能力。

图|整体性能概览。

更重要的是,SEED只依赖自身的策略模型,推理时不需要额外记忆或提示,就能保留那些可复用的行为经验。换句话说,它把复盘能力真正内化到了模型里。

SEED:自进化同策略框架

SEED的全称是SElf-Evolving On-Policy Distillation,是一个自进化的OPD框架。它会把当前策略完成的任务轨迹总结为后见技能,再将技能的行为指导蒸馏回策略模型。由此形成的训练信号有三个鲜明特点:来自当前策略的轨迹、能细化到单个决策token,而且会随着策略更新一起进化。

整个框架分为两个阶段:

1. 后见技能监督微调(hindsight skill SFT)

先收集基础策略的交互轨迹,再由外部分析器将完整轨迹总结为后见技能。成功轨迹对应可复用的策略或工作流,失败轨迹则提炼出纠正或规避规则。随后,这些轨迹-技能对被用来微调模型,使其具备轨迹分析能力,并为后续的RL actor和分析器打好基础。

2. 自进化同策略蒸馏(self-evolving on-policy distillation)

在强化学习过程中,当前的策略模型身兼二职:既采样任务轨迹,也作为分析器从这些轨迹中提取可复用的后见技能。接着,SEED会比较模型在有无后见技能时,对同一批动作的判断变化,并将这种变化转化为OPD训练信号,与GRPO一起优化。通过反复执行“收集轨迹、分析技能、重新评分、蒸馏更新”的循环,后见技能在多轮训练中被逐步蒸馏回策略。

图|SEED概览。

更高性能、更强泛化

研究团队在具身交互、网页导航和搜索问答三类长程任务上对SEED进行了评估。整体来看,SEED在所有基准上的表现均显著优于基于结果的RL和静态蒸馏方法,样本效率和泛化能力也更为突出。

1. 基准测试表现

SEED通过密集的token级监督,弥补了仅依赖终端奖励的RL的不足。与GRPO相比,SEED在三个基准上稳定提升,ALFWorld上甚至提升了45.9个百分点。内化技能的效果也优于上下文提示——与Skill-Prompt相比,SEED在推理时不需要额外技能提示,表现反而更好。相比OPSD、Skill-SD等静态蒸馏方法,SEED的领先优势明显,尤其在ALFWorld上。这说明,动态更新的后见监督远比静态方案更有效,也更能适应训练中不断出现的轨迹和失败模式。

图|在ALFWorld、Search-based QA和WebShop代表性长程基准上的性能比较。

2. 训练动态与样本效率

以ALFWorld为例,SEED在训练早期的成功率就明显领先GRPO,平均回合长度下降更快,任务执行效率更高。更值得注意的是,SEED只使用60%的训练数据,表现就超过了使用完整数据训练的GRPO。这意味着,从完成轨迹中提取的信息量,远胜于盲目堆数据。

图|ALFWorld上的训练动态。

图|ALFWorld上的训练动态。

3. 跨领域泛化能力与多模态扩展

在ALFWorld未见任务集上,使用Qwen2.5-3B-Instruct训练的模型,宏平均成功率从70.9%跃升至86.2%,在大多数任务族上显著超越GRPO。尤其在加热物体、查看物体和拾取物体等任务上,提升最为明显。SEED的能力同样适用于视觉任务。在Sokoban和EZPoints两个视觉Agent基准上,Qwen2.5-VL-3B-Instruct的平均成功率从77.0%提高到91.0%,且评估时不需要额外skill提示。

图|ALFWorld Unseen上的跨领域泛化能力。

图|基于视觉的智能体基准上的结果。

4. 消融分析

为验证各组件的贡献,研究团队在ALFWorld上进行了消融实验。结果显示,去掉后见技能SFT或自进化OPD都会降低性能,而使用静态技能库替代策略自身生成的技能时,性能退化最为明显。这说明,关键不在于技能本身,而在于技能是否来自当前策略的实时演化。

图|消融实验结果。

不足和未来发展

尽管SEED在许多任务中表现稳定,研究团队也坦诚指出了其局限性。首先,在DeepPlanning、OdysseyArena等包含更长工作流和更稀疏最终信号的基准上,SEED的效果仍有待验证。其次,自进化机制存在一个潜在风险:行动器和分析器共用同一套策略,如果模型在执行时犯错,可能会把无效做法总结成可复用经验,并在后续更新中持续强化。未来的改进方向包括将技能更新更多建立在可验证的状态变化之上,或引入不确定性感知机制来筛选更可靠的指导信息。此外,训练成本也会随任务复杂度上升而增加——虽然SEED不会增加部署开销,但在训练阶段仍需分析轨迹并进行成对评分。未来可以通过只分析关键轨迹、批量完成评分等方式进一步降低成本。

更多技术细节,请参见原论文。

本文转载于:https://www.163.com/dy/article/L2C2FQSA0531E3NX.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注