当前位置:

首页 > 硬件相关 > ICML 2026:从输入输出样例中自动生成程序——强化学习为大模型Programming-By-Example任务提供推理过程监督

ICML 2026:从输入输出样例中自动生成程序——强化学习为大模型Programming-By-Example任务提供推理过程监督

针对编程示例任务中缺乏过程监督的问题,提出PRM-PBE框架,通过反馈引导构建推理树生成过程监督数据,训练过程奖励模型评估中间推理步骤,并采用三阶段课程学习与PPO优化。在多个基准上,以DeepSeek-Coder-V2为基础模型,Pass@1提升至56.61%,显著优于现有方法。

ICML 2026

PRM-PBE方法示意图

尽管大语言模型在代码生成和程序推理任务中一路高歌猛进,但在Programming-by-Example(PBE)这一经典场景中,表现仍有明显短板。PBE任务要求模型只根据输入输出样例,去反推底层程序逻辑——这活儿看着简单,做起来其实相当棘手。目前的方法往往依赖输入到输出的直接对应,或借助Chain-of-Thought、执行反馈、监督微调等方式来增强推理能力。但问题是,这类方法对推理过程的监督颗粒度不够细,模型容易学出只满足一部分样例的“捷径”程序,或者在复杂逻辑归纳时跑偏。

最近,来自北京大学、京东、华东师范大学以及实验室的研究团队联合出手,针对PBE场景中缺乏过程监督的问题,提出了一套名为PRM-PBE的过程奖励强化学习框架。这套框架的核心思路是:通过反馈引导的方式构建推理树,生成高质量的过程监督数据,再训练一个Process Reward Model(PRM)来评估每一步推理的质量,最后按失败模式分阶段进行课程学习和PPO优化。相关论文已发表,标题为PRM-PBE : Process Reward Model for Reinforcement Learning in Programming-by-Example,作者包括房越、金芝、安杰、陈宏申、张锴等。

现有PBE方法缺乏对推理过程的精细监督

Programming-by-Example的核心目标,就是从少量输入输出样例中,准确推断用户想要的程序逻辑。传统PBE系统通常依赖预定义的领域特定语言,通过符号搜索、递归分解或神经网络引导来完成程序合成。随着大语言模型的崛起,PBE不再受限于特定DSL,模型可以直接基于自然语言提示、输入输出样例和推理链,生成通用的代码。

但是,论文指出,当前基于LLM的PBE方法有一个核心缺陷:模型主要学习的是输入与输出之间的表层映射,而中间归纳过程却缺少有效监督。对于复杂的PBE任务,光是端到端生成,很容易出现两类错误:第一类是模型推断出的逻辑完全跑偏,比如把“多个列表中相同位置元素相等的索引”搞混成简单的集合交集;第二类是模型生成只覆盖部分样例的程序,比如要求降序排序,模型却只做了反转操作,结果在部分输入输出上看似正确,实际却与真实规则差之千里。

这些失败的案例说明,PBE的难点从来不只在最终的代码能否通过测试,而在于模型能否在推理过程中一步步接近样例背后的潜在意图。如果缺少对推理步骤的明确监督,模型很容易沿着错误的归纳方向一路跑偏,最终产出一个看似合理但逻辑不完整的程序。

用反馈引导的推理树构建过程监督数据

针对中间推理过程难以监督的问题,论文提出了一套反馈引导的推理树构建方法。推理树里的每个节点都对应一个自然语言形式的中间推理步骤,模型从输入输出样例出发,逐步采样后续推理节点,直到形成完整的推理链。由于这些中间节点本身不能直接执行程序,系统会在路径完成后,把它们转化为完整的程序,并通过执行测试来判断是否满足所有样例。

在此基础上,论文用后续路径的成功比例来给节点打分。如果一个节点的大部分后续路径都能导向正确程序,就说明这个推理状态还算靠谱。反过来,如果某个推理前缀的所有后续路径都失败了,系统就会把它标记为潜在的逻辑偏离点,然后引入外部自然语言指令进行定向修复,从而生成更多高质量的正样本。这一招有效缓解了PBE过程监督数据中正样本稀疏的难题。

用后继成功率训练过程奖励模型

完成推理树构建后,论文接着训练了一个Process Reward Model来评估中间推理步骤的质量。PRM不直接判断最终程序对不对,而是为每一个推理状态分配一个奖励分数,用来估算“从这个状态继续生成,有多大可能做出正确的程序”。

具体来说,论文把节点的后继成功率作为训练信号。如果节点A的后续采样路径更容易生成正确程序,而节点B的后续路径更容易失败,那么训练目标就要求PRM给节点A打出更高的分数。相比简单的正负样本分类,这种偏好学习能更细致地区分不同推理状态的可靠程度,让模型学会识别更可能通向正确程序的归纳方向。

三阶段课程学习将过程奖励注入强化学习

获得PRM之后,论文把它接入强化学习框架,用过程级奖励来优化程序合成模型。为了提升训练稳定性,团队设计了一套按失败模式组织的三阶段课程学习策略,让模型从基础可执行性逐步过渡到复杂的逻辑正确性。

第一阶段专注处理语法错误和运行时错误,目标是训练模型生成能正常执行的程序。第二阶段则处理那些可执行但行为完全不对的程序,引导模型学习输入输出样例里的核心约束。第三阶段专门应对只能通过部分样例的程序,帮助模型减少对有限样例的过拟合。在每个阶段中,PRM都会给中间推理状态提供奖励,然后通过PPO更新策略模型。这样一来,模型就能一步步学会更可靠的程序归纳路径。

多基准实验验证PRM-PBE的有效性

论文在PROSE、SyGuS、Playgol、Lists和MBPP五个代表性PBE基准上做了实验,覆盖字符串处理、列表操作、归纳逻辑程序设计以及MBPP改造来的输入输出样例合成任务。实验中还比较了多种闭源与开源的大语言模型,包括GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Flash、Qwen2.5-Coder、DeepSeek-Coder-V2、Llama-3和Qwen3。

主实验结果显示,PRM-PBE在所有基准上均显著优于现有基线方法。以DeepSeek-Coder-V2为基础模型时,SFT的平均Pass@1是42.76%,而PRM-PBE直接提升到了56.61%,整整多了13.85个百分点。哪怕和最强非PRM基线——Claude-3.5-Sonnet的WPS方法相比,PRM-PBE仍然高出8.73个百分点。这个结果说明,对于复杂的PBE任务,光靠提示工程、搜索反馈或监督微调还不够,显式的过程奖励才能更有效地提升程序合成的准确率。

实验效果对比

为PBE程序合成提供过程监督的新范式

这项工作的价值在于,它把PBE中最难监督的那个环节——从样例归纳程序意图——显式建模出来,并用过程奖励为强化学习提供了比最终执行结果更细粒度的训练信号。相较于只判断程序是否通过测试,PRM-PBE能够进一步识别推理路径中的偏离点,减少那些只满足部分样例的捷径程序,让模型更可靠地捕捉输入输出样例背后的全局逻辑。

更进一步,这一框架也为后续LLM程序合成研究打开了一条新思路:面对很多难以直接标注中间过程的任务,可以通过“采样后续路径、验证最终结果、反推中间状态价值”的方式来构建过程监督信号。随着更强的代码模型和自动验证工具不断演进,类似的过程奖励机制有望扩展到更复杂的程序归纳、算法生成以及真实软件工程任务中去。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
硬件相关 强化学习
相关文章 更多
显示器色温怎么调不刺眼?色温调多少看着最舒服
显示器色温怎么调不刺眼?色温调多少看着最舒服

详解显示器色温的舒适调节区间、刺眼的核心诱因,以及在不同使用场景与环境光下的具体调节步骤与校准方法。

显卡风扇不转怎么回事判断是否正常及解决方法
显卡风扇不转怎么回事判断是否正常及解决方法

发现显卡风扇不转先别慌,这很可能是正常的智能启停功能。本文详解如何区分待机静音与硬件故障,提供从软件检测到物理清理的完整解决思路。

笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

PDF教程
PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
Shapr3D macOS版
Shapr3D macOS版
Mac

Shapr3D是一款面向工业设计、机械工程、建筑概念和三维打印工作流的CAD软件。Mac版采用Parasolid建模内核,支持草图约束、实体建模、工程图、可视化渲染及常见CAD格式交换,并可通过账户在多台设备之间同步项目。

REAPER macOS版
REAPER macOS版
Mac

REAPER是Cockos开发的数字音频工作站,提供多轨音频与MIDI录制、剪辑、处理、混音和母带制作工具。Mac版兼容Intel与Apple芯片,支持AU、VST、VST3、CLAP等插件格式,并提供高度可定制的工作流程。

Ableton Live macOS版
Ableton Live macOS版
Mac

Ableton Live 是面向音乐制作人与现场表演者的数字音频工作站,提供编曲视图、独具特色的现场视图、音频录制、MIDI创作、实时变速、乐器及效果器。Mac版原生支持Apple芯片,并可连接音频接口、MIDI控制器和第三方插件。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。