商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练

Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练

  发布于2026-07-28 阅读(0)

扫一扫,手机访问

在任意 Harness 中训练 Agent,这事儿听着挺美,但实际操作起来,却是个公认的难题。

问题出在哪儿呢?Harness 的推理过程通常是有状态的,而且是多进程的。主流的开源 RL 框架默认走本地 rollout 路线,很难直接和原始 harness 对接。如果训练阶段改用简化版 harness,交互流程又可能偏离部署环境,导致训练和部署“两张皮”。

针对这个顽疾,来自微软和哥伦比亚大学的研究团队拿出了一套名为 OpenForge RL 的解决方案。这玩意儿是个轻量级的 Agent 端到端训练框架,核心思路很巧妙——它通过一个轻量级 Agent 记录模型的每一次调用,等 rollout 结束后,把这些调用记录重新组装成训练框架能用的标准数据格式。然后,由 Kubernetes 编排器在独立的容器里调度 rollout。这样一来,就能在任何 harness 和环境中进行大规模训练了。


结果相当亮眼:经 OpenForge RL 训练过的模型,在几乎所有基准测试上都优于同等规模的开源模型,样本效率更高,跨 harness 的泛化能力也更强。


图|左侧:OPENFORGE RL 构建在 Orchard Env上,并将任意 harness × 任意环境连接到 veRL 等标准 RL 代码库,不存在训练-部署不匹配。右侧:使用 OPENFORGE 训练得到的模型,在 6 种 harness 上,跨六个 Claw 和 GUI 环境进行评估。

话说回来,强化学习(RL)虽然大幅提升了 Agent 在复杂工具调用和多步交互任务中的可靠性,但自我纠错能力依然是块明显的短板。

研究团队表示,这项工作的初衷,就是让研究人员能在真实部署的 harness 和环境中训练并改进 Agent,从而降低研究门槛。

OpenForge RL:Harness原生Agent训练框架

简单来说,OpenForge RL 是一个即插即用的 rollout 接口,专门用来把分布式 harness rollout 接入 veRL 这种 RL 框架。它在 harness 和推理服务器之间加了一个 Agent 层,负责记录模型调用,等 rollout 跑完,再把这些记录重构为标准 RL 训练轨迹。这样一来,harness 代码完全不用动,就能通过 Kubernetes 编排器扩展到数千个并发环境。

具体流程可以拆成两个部分:

1. Agent:它负责包装 vLLM 等推理服务器,记录 rollout 过程中的生成请求和模型回复;任务跑完后,收集终止奖励,并将 prompt-response 记录重构为训练轨迹。像 GRPO 这种基于组的算法,则根据同组轨迹的平均奖励来计算优势值。

2. Kubernetes 编排器:负责在 Azure 等云上创建、管理和回收 rollout 容器。每个容器都有独立的 CPU 和内存,与训练节点分离运行,足以支撑大规模并发 rollout。

为了防止远程 rollout 掉链子影响训练,OpenForge RL 还内置了两套容错机制:

1. 墙钟超时:给每个 rollout 任务设定一个时间上限,超时了就终止,并返回错误信号,让训练器能继续从其他 rollout 中收集数据。

2. 异常 rollout 丢弃:如果 rollout 因为网络问题、任务故障或 harness 故障失败,OpenForge RL 不会给它分配奖励,直接丢弃,避免引入误导性训练信号。


图|OPENFORGE RL 概览。

为了支持在多样化的环境中开展实验,研究团队还搭建了一条简单的任务生成流水线。流程大致是:先生成指令,再过滤任务,然后构建 Docker 环境和验证脚本,最后用开放 LLM/VLM 试跑并修补,直到通过端到端检查。环境可以预装 OpenClaw、Codex 等 harness,生成的任务可以同时用于 SFT 和 RL。


图|数据/任务合成流水线的概览。

同规模领先,跨harness泛化更强

研究团队在工具使用(Claw)和多模态 GUI 两类长程任务上对 OpenForge RL 进行了评估。整体来看,OpenForge 训练的模型在几乎所有基准上均优于同等规模的开源模型,样本效率更高,跨 harness 泛化能力也更强。

1. 基准测试表现

在 Claw 任务上,OpenForge-Claw 在多个基准上超过了同规模模型,说明当前的任务环境能为模型提供有效的训练信号。相比仅经过 SFT 训练的模型,经过 SFT+RL 训练的模型在鲁棒性和平均成功率上都有明显提升。


图|Claw Agent 在 Claw-Eval、QwenClawBench 和 MCPAtlas 上的表现。

在 GUI 任务上,OpenForge-GUI 同样表现出很强的竞争力。对比一下:使用 20 万+ 任务训练的 MolmoWeb,OpenForge-GUI 只用 2.5k 个任务,就在 Online-Mind2Web 上超过了前者,同时在 WebVoyager 上保持了竞争力。OpenForge-GUI 不仅优于相近规模的开放基线,还在 GUI 设置中追平甚至超过了数倍更大的模型。经过 SFT+RL 训练后,它在 3 个基准上也均优于仅 SFT 版本。


图|GUI Agent 在 OSWorld-Verified、OnlineMind2Web 和 WebVoyager 上的表现。

2. 跨 Harness 泛化能力

研究团队进一步考察了模型在不同 harness 下的泛化表现。结果很能说明问题:单一 harness 训练已经具备一定的迁移能力,而多 harness 联合训练整体效果更优,尤其是在复杂 harness 上的收益更为明显。

不同 harness 的学习难度差异显著。在 ClawEval 中,研究团队使用 ReACT、ZeroClaw、OpenClaw 和 Codex 等 harness 进行评估,结果发现,工具接入更灵活的 harness 得分最高。SFT+RL 能提升大多数 harness 的表现,但在 OpenClaw 上带来的提升相对有限,这可能与它更长的 prompt 和更复杂的上下文有关。

多 harness 联合训练的优势则更为突出。例如,在 ZeroClaw 上的分数从 46.0 提高到了 48.5。研究团队认为,这可能是因为多 harness 训练引入了更多样化的工具调用方式和控制流程。


图|在不同 harness 下比较 OpenForge-Claw 在 ClawEval 上的表现。

在未见 harness 的评估中,单 harness 训练也表现出了一定的迁移能力。例如,仅在 ZeroClaw 上训练的模型,在未参与训练的 OpenClaw 和 Codex 上也能看到提升。相比之下,多 harness 联合训练的整体表现更好,更丰富的工具调用方式和控制流程,确实有助于提升泛化能力。


图|未见 harness 评估。

3. RL 学到的能力

RL 让模型变得更聪明了——它不再那么依赖通用的 shell,而是更倾向于选择合适的专用工具。在 ZeroClaw harness 下,通用 shell 的调用占比从 22.6% 降到了 13.9%,调用方向转向了专用服务工具,轨迹长度也略有缩短。

另外,RL 还提升了多项 Agent 的可靠性指标。在 Codex harness 下,模型的自我验证能力、工具覆盖率以及格式鲁棒性都有了明显提升。


图|SFT 与 SFT+RL 在 ClawEval 上的行为比较。

不足和未来发展

尽管 OpenForge RL 在基准测试和跨 harness 泛化实验中拿出了不错的结果,但依然有几块短板需要补上。

首先是异常 rollout 的处理,目前还是比较保守。运行 rollout 任务的容器可能因为网络错误、harness 崩溃或超时而中断。未来,研究团队打算进一步研究部分 rollout 的信用分配问题,让那些有效的交互步骤也能被用于训练。

其次,错误恢复能力依然不足。RL 虽然能提升自我验证、工具覆盖和多步计划等能力,但错误恢复在 RL 后仍然是弱项。后续研究将针对错误恢复构建专门的数据,并探索相应的训练方法,来进一步强化这类能力。

此外,数据和基础设施仍然是扩展到更多 Agent 环境的门槛。研究团队表示,后续会公开代码、数据集和模型,希望能降低在真实 harness 和环境中训练 Agent 的门槛。

本文转载于:https://www.163.com/dy/article/L2UGMPTC0531E3NX.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注