翁荔新博客提出「自进化先从Harness开始」,DeepSeek崔添翼转发附议

量子位 2026-07-08T09:57:42.389942

翁荔在最新博客中提出,AI自进化的现实路径可能并非直接修改模型权重,而是优化模型外部的Harness系统。她详细阐述了从Context Engineering到Workflow Design的递进优化层次,认为近期可行的自进化方向在于模型改进自身获取答案的方式。DeepSeek研究员崔添翼转发并强调,Harness方向的自进化与模型方向同样具有潜力。

前OpenAI安全副总裁、Thinking Machines Lab联合创始人翁荔近日发布新博客,聚焦AI自进化话题,提出一条现实路径:自进化不一定从模型直接改写自身权重开始,而应从Harness入手

![][/static/images/articles/2178/0562ed76e86f411264b8648e7bf77946.webp]

博客题为《Harness Engineering for Self-Improvement》。

![][/static/images/articles/2178/52d92eee41c3a1cd2fa0a256cfddb5bb.webp]

其中,Harness可简单理解为模型外部的运行系统,决定了模型如何调用工具、管理上下文、读写文件、拆分任务、调用子Agent、验证结果,以及从失败中复盘。

DeepSeek研究员崔添翼第一时间转发并划出重点:Harness方向的自进化,和模型方向的自进化一样,都是非常可能出成果的方向

![][/static/images/articles/2178/8261c600d4433fcbeeb1df5ea67c33a7.webp]

他还指出,Skill是Harness自进化中较初级的一种形式——从prompt层面进行自进化。

![][/static/images/articles/2178/776c578efc8d99d55b595eb1d3ad5785.jpeg]

自进化可能先发生在Harness层

翁荔这篇博客的核心概念是RSI(Recursive Self-Improvement,递归自我改进)。该概念最初带有浓厚的AGI色彩,指智能系统能改进自身智能的生成机制,从而产生更强的后继系统。

然而,翁荔从工程角度对这一问题进行了拆分。在当代AI系统中,自我改进未必仅意味着模型直接改写权重;它也可以指模型改进训练流程、研究流程和部署系统,从而帮助下一代系统在真实任务中表现更佳。

![△AI生成][/static/images/articles/2178/b7c4ed8400d3105a27f9b8acd136f389.webp]

而Harness正是部署系统中最关键的一层。

过去讨论Agent时,常见表述是「LLM + 记忆 + 工具 + 规划 + 行动」。但在翁荔看来,Harness已超越早期Agent框架中的几个模块,更接近运行时和软件系统设计。它决定了模型如何观察环境、如何行动、如何管理上下文、如何保存状态、如何评估结果,以及能否在长任务中持续迭代。

因此,她的判断是:近期更可行的自进化路径,可能并非模型直接重写其大脑,而是模型开始优化自身获取答案的方式

从Context Engineering到Self-Harness,优化层层递进

翁荔梳理了近期相关研究,呈现出一个清晰趋势:优化对象正在从上下文、工作流,一步步深入到Harness本身

递进链条为:prompt → structured context → workflow → harness code → optimizer code。

随着模型能力增强,可优化的对象也变得更抽象、更通用。

第一层:Context Engineering

最基础的问题是:Agent执行长任务时,上下文会越塞越多,很快失控。

翁荔提到两个代表性工作:ACEMCE

ACE(Agentic Context Engineering)将上下文视为一本持续更新的「操作手册」,而非一段不断变长的提示词。

![][/static/images/articles/2178/829d5e4924bdd51da536e3d056b03e67.webp]

它由三个角色协作:Generator负责生成任务轨迹,Reflector从成功与失败的轨迹中提炼要点,Curator将这些要点整理为结构化条目,并增量更新至手册。

MCE(Meta Context Engineering)则更进一步,将「如何管理上下文」和「上下文具体放什么」拆分为两层优化:外层进化管理上下文的技能,内层则用该技能优化具体任务的上下文。

![][/static/images/articles/2178/aac71721bd0baabfad62b8767c689205.webp]

翁荔认为,相比ACE仍需人工设计更新规则,MCE朝「自我管理的记忆」又迈进了一步。

第二层:Workflow Design

这一层解决的是「模型该如何干活」的问题。

翁荔以AI Scientist为例:它构建了一条从提出想法、写代码、跑实验、分析结果,到撰写论文、同行评审的完整科研流水线。

关键要点

从人工设计工作流到模型自主优化,再到整个Harness系统本身成为可搜索对象,Agent的自我进化正在层层递进。本文深入解析翁荔提出的三层递进逻辑,重点介绍Self-Improving Harness的闭环机制,以及进化搜索在多个基准上的惊人表现。

从流程工程到流程搜索:三层递进

Agent系统的优化正在经历一场深刻的范式转移。其核心递进逻辑可以概括为三个层次:

第一层:人工流程工程化

人类将任务流程拆解为清晰的步骤和模块,手工设计Agent的工作流。

第二层:模型参与流程设计

ADAS(Agent Design via Automated Search)进一步将“设计Agent工作流”本身视为一个可搜索的优化问题——让一个元智能体不断提出新的工作流设计并接受评估。

![][/static/images/articles/2178/cabd1f267c64e5db0c60058defa9a005.webp]

AFlow则将工作流表示为一张图,利用蒙特卡洛树搜索(MCTS)去寻找更优的图结构。

![][/static/images/articles/2178/ad7f86af4330ae01c66033cf453ef36f.webp]

这一递进的关键在于:优化对象不再是单个prompt,而是整个Agent如何组织行动。流程结构本身也进入了搜索空间。

第三层:Self-Improving Harness

这是最前沿的一层。模型不仅使用Harness完成任务,还开始分析Harness存在的缺陷,并提出修改方案。

翁荔重点介绍了Self-Harness这类工作,其循环非常清晰:

![][/static/images/articles/2178/f3dab4d77655d3a4e5e107969fca8246.webp]

Step 1: Weakness Mining(弱点挖掘)

系统首先收集Agent执行任务时留下的轨迹,包括工具调用、错误日志、失败结果、验证器反馈等。从中挖掘反复出现的失败模式。

例如:模型总是在某类任务中遗漏文件;总是特定测试失败后重复尝试无效修复;总是上下文变长后丢掉关键约束。

Step 2: Harness Proposal(Harness提案)

模型基于这些失败模式,提出对Harness的小范围修改。关键原则是“小范围”和“可验证”。

模型能参考的信息包括:当前Harness中可修改的部分、具体的失败模式、必须保留的“正确行为”、以及之前已尝试过的修改记录。

提案需聚焦于能通过小范围改动解决的、可复现的问题,且不同提案之间要保持差异化。

Step 3: Proposal Validation(提案验证)

候选修改不能直接合入,必须经过测试验证。只有确认其确实提升了表现,且未引入明显回归(regression),才会成为下一版Harness的一部分。

翁荔指出,这套流程在MiniMax M2.5、Qwen3.5、GLM-5等不同模型上运行Terminal-Bench-2时,确实学习出了针对不同模型薄弱点、各不相同的Harness配置。

不过,她也直接点出了隐患:一旦允许程序自行修改系统层代码,抽象边界就有被打破的风险。权限控制和安全层必须留在此循环之外,而reward hacking(奖励黑客)的老问题也依然存在。

进化搜索:Harness成为演化对象

如果说Self-Harness更像是从失败中修补工作系统,那么进化搜索(Evolutionary Search)则是把Harness直接变成一个可搜索对象。

其逻辑更像自然选择:
1. 生成多个候选Harness
2. 让模型基于已有版本做修改
3. 用benchmark或验证器评估表现
4. 保留更好版本,淘汰较差版本
5. 进入下一轮迭代

翁荔特别提到了DGM(Darwin Gödel Machine):直接让一个coding agent去修改自己的Harness代码仓库本身。

![][/static/images/articles/2178/14d5200dc1a99de766f637c49d9e2bf6.webp]

实验中使用Claude 3.5 Sonnet作为基座模型,从简单的初始配置出发,DGM进化出的agent效果惊人:
- 在SWE-bench Verified上的表现从20%提升到50%
- 在Polyglot上从14.2%提升到30.7%
- 达到甚至超过了人工设计的agent

![][/static/images/articles/2178/b296f2d86992470897100a9c36a2fccb.webp]

这表明,即使不动模型权重,Harness本身已经可以成为能力提升的搜索空间。

不过,这类方法更适合代码、算法、GPU kernel等可自动评估的任务。如果任务涉及科研品味、产品长期质量、复杂组织协作,评估就会慢得多、模糊得多。

Harness会变强,但依然有边界

翁荔并不认为Harness可以替代模型训练,她的判断更倾向于二者互相强化

足够成熟的Harness能让模型自我改进的研究循环跑起来;更聪明的模型又能防止Harness被过度设计,保持系统的可持续性。

长期看,Harness的许多改进最终可能被“内化”进模型本身的行为——就像提示词工程中的手动技巧,随着模型的指令跟随和推理能力变强而逐渐不那么重要。但“说清楚目标、约束、上下文、评估标准”这件事本身,从未消失。

她也没有回避实现递归自我改进(RSI)当前存在的瓶颈:安全性、评估可扩展性、以及抽象边界的维护。

查看原文