发布于2026-07-28 阅读(0)
扫一扫,手机访问
在任意 Harness 中训练 Agent,这事儿听着挺美,但实际操作起来,却是个公认的难题。
问题出在哪儿呢?Harness 的推理过程通常是有状态的,而且是多进程的。主流的开源 RL 框架默认走本地 rollout 路线,很难直接和原始 harness 对接。如果训练阶段改用简化版 harness,交互流程又可能偏离部署环境,导致训练和部署“两张皮”。
针对这个顽疾,来自微软和哥伦比亚大学的研究团队拿出了一套名为 OpenForge RL 的解决方案。这玩意儿是个轻量级的 Agent 端到端训练框架,核心思路很巧妙——它通过一个轻量级 Agent 记录模型的每一次调用,等 rollout 结束后,把这些调用记录重新组装成训练框架能用的标准数据格式。然后,由 Kubernetes 编排器在独立的容器里调度 rollout。这样一来,就能在任何 harness 和环境中进行大规模训练了。

结果相当亮眼:经 OpenForge RL 训练过的模型,在几乎所有基准测试上都优于同等规模的开源模型,样本效率更高,跨 harness 的泛化能力也更强。

图|左侧:OPENFORGE RL 构建在 Orchard Env上,并将任意 harness × 任意环境连接到 veRL 等标准 RL 代码库,不存在训练-部署不匹配。右侧:使用 OPENFORGE 训练得到的模型,在 6 种 harness 上,跨六个 Claw 和 GUI 环境进行评估。
话说回来,强化学习(RL)虽然大幅提升了 Agent 在复杂工具调用和多步交互任务中的可靠性,但自我纠错能力依然是块明显的短板。
研究团队表示,这项工作的初衷,就是让研究人员能在真实部署的 harness 和环境中训练并改进 Agent,从而降低研究门槛。
简单来说,OpenForge RL 是一个即插即用的 rollout 接口,专门用来把分布式 harness rollout 接入 veRL 这种 RL 框架。它在 harness 和推理服务器之间加了一个 Agent 层,负责记录模型调用,等 rollout 跑完,再把这些记录重构为标准 RL 训练轨迹。这样一来,harness 代码完全不用动,就能通过 Kubernetes 编排器扩展到数千个并发环境。
具体流程可以拆成两个部分:
1. Agent:它负责包装 vLLM 等推理服务器,记录 rollout 过程中的生成请求和模型回复;任务跑完后,收集终止奖励,并将 prompt-response 记录重构为训练轨迹。像 GRPO 这种基于组的算法,则根据同组轨迹的平均奖励来计算优势值。
2. Kubernetes 编排器:负责在 Azure 等云上创建、管理和回收 rollout 容器。每个容器都有独立的 CPU 和内存,与训练节点分离运行,足以支撑大规模并发 rollout。
为了防止远程 rollout 掉链子影响训练,OpenForge RL 还内置了两套容错机制:
1. 墙钟超时:给每个 rollout 任务设定一个时间上限,超时了就终止,并返回错误信号,让训练器能继续从其他 rollout 中收集数据。
2. 异常 rollout 丢弃:如果 rollout 因为网络问题、任务故障或 harness 故障失败,OpenForge RL 不会给它分配奖励,直接丢弃,避免引入误导性训练信号。

图|OPENFORGE RL 概览。
为了支持在多样化的环境中开展实验,研究团队还搭建了一条简单的任务生成流水线。流程大致是:先生成指令,再过滤任务,然后构建 Docker 环境和验证脚本,最后用开放 LLM/VLM 试跑并修补,直到通过端到端检查。环境可以预装 OpenClaw、Codex 等 harness,生成的任务可以同时用于 SFT 和 RL。

图|数据/任务合成流水线的概览。
研究团队在工具使用(Claw)和多模态 GUI 两类长程任务上对 OpenForge RL 进行了评估。整体来看,OpenForge 训练的模型在几乎所有基准上均优于同等规模的开源模型,样本效率更高,跨 harness 泛化能力也更强。
在 Claw 任务上,OpenForge-Claw 在多个基准上超过了同规模模型,说明当前的任务环境能为模型提供有效的训练信号。相比仅经过 SFT 训练的模型,经过 SFT+RL 训练的模型在鲁棒性和平均成功率上都有明显提升。

图|Claw Agent 在 Claw-Eval、QwenClawBench 和 MCPAtlas 上的表现。
在 GUI 任务上,OpenForge-GUI 同样表现出很强的竞争力。对比一下:使用 20 万+ 任务训练的 MolmoWeb,OpenForge-GUI 只用 2.5k 个任务,就在 Online-Mind2Web 上超过了前者,同时在 WebVoyager 上保持了竞争力。OpenForge-GUI 不仅优于相近规模的开放基线,还在 GUI 设置中追平甚至超过了数倍更大的模型。经过 SFT+RL 训练后,它在 3 个基准上也均优于仅 SFT 版本。

图|GUI Agent 在 OSWorld-Verified、OnlineMind2Web 和 WebVoyager 上的表现。
研究团队进一步考察了模型在不同 harness 下的泛化表现。结果很能说明问题:单一 harness 训练已经具备一定的迁移能力,而多 harness 联合训练整体效果更优,尤其是在复杂 harness 上的收益更为明显。
不同 harness 的学习难度差异显著。在 ClawEval 中,研究团队使用 ReACT、ZeroClaw、OpenClaw 和 Codex 等 harness 进行评估,结果发现,工具接入更灵活的 harness 得分最高。SFT+RL 能提升大多数 harness 的表现,但在 OpenClaw 上带来的提升相对有限,这可能与它更长的 prompt 和更复杂的上下文有关。
多 harness 联合训练的优势则更为突出。例如,在 ZeroClaw 上的分数从 46.0 提高到了 48.5。研究团队认为,这可能是因为多 harness 训练引入了更多样化的工具调用方式和控制流程。

图|在不同 harness 下比较 OpenForge-Claw 在 ClawEval 上的表现。
在未见 harness 的评估中,单 harness 训练也表现出了一定的迁移能力。例如,仅在 ZeroClaw 上训练的模型,在未参与训练的 OpenClaw 和 Codex 上也能看到提升。相比之下,多 harness 联合训练的整体表现更好,更丰富的工具调用方式和控制流程,确实有助于提升泛化能力。

图|未见 harness 评估。
RL 让模型变得更聪明了——它不再那么依赖通用的 shell,而是更倾向于选择合适的专用工具。在 ZeroClaw harness 下,通用 shell 的调用占比从 22.6% 降到了 13.9%,调用方向转向了专用服务工具,轨迹长度也略有缩短。
另外,RL 还提升了多项 Agent 的可靠性指标。在 Codex harness 下,模型的自我验证能力、工具覆盖率以及格式鲁棒性都有了明显提升。

图|SFT 与 SFT+RL 在 ClawEval 上的行为比较。
尽管 OpenForge RL 在基准测试和跨 harness 泛化实验中拿出了不错的结果,但依然有几块短板需要补上。
首先是异常 rollout 的处理,目前还是比较保守。运行 rollout 任务的容器可能因为网络错误、harness 崩溃或超时而中断。未来,研究团队打算进一步研究部分 rollout 的信用分配问题,让那些有效的交互步骤也能被用于训练。
其次,错误恢复能力依然不足。RL 虽然能提升自我验证、工具覆盖和多步计划等能力,但错误恢复在 RL 后仍然是弱项。后续研究将针对错误恢复构建专门的数据,并探索相应的训练方法,来进一步强化这类能力。
此外,数据和基础设施仍然是扩展到更多 Agent 环境的门槛。研究团队表示,后续会公开代码、数据集和模型,希望能降低在真实 harness 和环境中训练 Agent 的门槛。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9