发布于2026-08-17 阅读(0)
扫一扫,手机访问
几天前,前 OpenAI 安全研究副总裁、Thinking Machines Lab 联合创始人翁荔(Lilian Weng)刚聊完 Scaling Laws 的可靠性问题,转身又贴出了一篇新博客,名字叫“Harness Engineering for Self-Improvement”[1]。这次她把火力集中在AI圈一个热火朝天的话题上——Harness Engineering,这东西如今已经被看作是AI Agent系统里一个相当关键的工程层。
如果你让我打个比方,Scaling Laws 决定的是一个模型的天花板有多高,那 Harness 就是这个模型在现实任务中能走多稳、走多远的那层操作系统。换句话说,模型本身的权重可能很久都变不了,但它外面那层“脚手架”却可以不断迭代升级。
翁荔在这篇新博文里,实际上是在追问一个核心问题:在真正能修改自身权重的“硬递归”还遥遥无期的时候,那种能持续实现递归自我提升(RSI,Recursive Self-Improvement)的循环,有没有可能先从模型外面的这层 Harness 开始跑起来?

图丨相关博客文章(来源:https://lilianweng.github.io/posts/)
那么,Harness 到底是什么?简单说,它是包裹在大模型外面的一套完整系统。可别把它当成一个简单的提示词模板——它更像是一个决定模型怎么思考、怎么规划、调用哪些工具和行动、怎么管理上下文、怎么执行工作流的运行时环境。翁荔在文章里举了个很生动的例子:当下像 Claude Code 和 Codex 这类成功的编程智能体产品,它们的核心优势很大程度就来自精心设计的 Harness。
一个成熟的 Harness,就好比操作系统。它能封住复杂的逻辑,同时对外保持接口简单:模型不用把整个工作流和所有日志都硬塞进有限的上下文窗口里,而是可以靠文件系统这样的持久化存储来管理状态和产物。这种设计模式,让智能体能处理更长周期的任务,也一定程度避免了在长上下文的混乱中迷路。

(来源:https://openai.com/index/unrolling-the-codex-agent-l
顺着这条思路,翁荔系统地梳理了近期一系列相关研究,总结出一条 Harness 从手工设计走向自我优化的演进路线。早期像 Agentic Context Engineering 这类框架,更像是在把上下文当作一本不断更新的“操作手册”——通过生成、反思、筛选的循环,让模型从成功或失败的轨迹里提炼出结构化的要点,从而更有效地管理记忆。

(来源:https://github.com/yasasbanukaofficial/claude-code)
再往前走一步,Meta Context Engineering 把上下文管理本身也变成了一个可以优化的对象——用一个元智能体去搜索和改进管理上下文的“技能”,实现双层优化。而像 Meta-Harness 这样的工作,则直接把 Harness 的代码本身当作搜索空间,让编码智能体去编写、测试、迭代新的 Harness 代码,甚至能生成多个候选方案,找出其中帕累托最优的那个。
这种让智能体自己改进系统代码的思路,在进化搜索领域也有体现。比如 Darwinian Gödel Machine 就提出了一种框架:让编码智能体能修改自己的 Harness 代码库,通过一个基于性能排名的选择机制,不断产生新版本。实验数据挺有意思:在 SWE-bench Verified 这类编程基准上,Darwinian Gödel Machine 发现的智能体能达到 20% 到 50% 的通过率,跟手工设计的智能体旗鼓相当,甚至更优。
不过,翁荔也特意强调,这并不意味着未来只优化 Harness 就够了。更长期来看,Harness 与模型权重的联合优化,仍然可能是递归自我提升的一个重要方向。

图丨智能体上下文工程的框架示意图(来源:https://arxiv.org/ab)
文章指出,这种“元方法论”的转向,可能是眼下最值得关注的趋势:我们不再只是让模型给出更好的答案,而是在制造一套能持续改进“如何获得更好答案”的机制。在这个回路里,Harness 自己成了优化对象,逐步摆脱对人工编写启发式规则的依赖,转向更多可自动搜索的通用机制。工程师的角色也跟着变了——从编写具体规则,变成设计更通用的进化框架。
但翁荔并没有把这路描绘得一片坦荡。她在文章后半段,客观列出了一系列现实瓶颈。其中最大的挑战之一来自评估。目前的自我改进循环,在那些有明确、快速、客观评估指标的任务上效果显著,比如写代码、解数学题。

图丨元上下文工程的框架示意图(来源:https://arxiv.org/abs/2)
可一旦碰到模糊的判断,比如“这项研究有没有品味”“这个结果是不是真的重要”,系统就很容易失效,甚至会为了通过测试而学会作弊——也就是所谓的“奖励黑客”。安全是另一个隐患。如果允许模型自由修改系统代码,那抽象边界和权限控制就会被打破,极有可能引发灾难性后果。所以翁荔特别强调:人类不是被排除在循环之外,而是需要向上移动,在环路外扮演架构师和方向指引者的角色,负责设计可编辑的边界和进行关键节点的审查。
文章结尾,翁荔没有端出一份迈向 RSI 的虚幻愿景,而是列了一张务实的挑战清单:怎么设计好的评估器、怎么管理上下文和长期任务的记忆、怎么解决进化中的多样性坍缩、怎么应对奖励黑客,以及怎么平衡短期任务成功和代码库长期健康之间的关系。她指出了一个容易被忽视的问题:目前大部分优化都基于沙盒内的短期奖励,但现实里的软件工程还要兼顾可维护性、向后兼容性和未来开发负担。这些“长期成功”的指标,正是当前系统最不擅长处理的。
如果说上篇关于 Scaling Laws 的文章是在提醒大家,那个用于规划数十亿算力投资的公式没那么可靠,那这篇关于 Harness 的文章更像是在告诉公众:通向递归自我提升的第一步,很可能不是修改模型本身,而是先优化模型外面那个不起眼的 Harness。而这条路本身,也布满了需要小心绕开的坑。
或许,真正的 RSI 不会在某一天突然降临,让模型自己改写自己——它更可能悄悄开始于一次次 Harness 优化之中。
参考资料:
1.https://lilianweng.github.io/posts/2026-07-04-harness/
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9