自我改进的智能体仍然需要人类

Douwe Osinga's Blog 2026-08-10T00:33:01.254487

Goodhart 定律是基准制定者的诅咒:当一个指标成为目标,它就不再是好指标。编程智能体的基准测试几乎就是为了触发这个定律而设计的。任务公开、结果只是一个数字,排行榜上不可避免地会堆满那些——往往并非有意——对基准过拟合的框架。这并不意味着 Terminal-bench 这个业界标准就没用了,只是改变了 goose 团队使用它的方式。排行榜是对智能体综合能力的一个噪声很大的衡量指标。真正的信号在于失败的模式:goose 反复卡壳的地方,或者 goose 失败而另一个框架成功的地方。这也是为什么我们通常用 Sonnet 而不是当前最强的模型来做基准测试。我们不是要追求尽可能大的数字。我们希望在桌面上留下足够多的失败,以便看清智能体缺少哪些支持。

机器人制造机器人

自我改进的智能体如今风头正劲,但我们信任的这种版本目前还需要人类参与。循环是这样的:先运行基准测试,让 goose 对比一个任务——某个框架成功、另一个框架失败——再请它用具体的语言解释差异在哪里。然后由人类通览几个这类失败,总结出一般性教训,再让 goose 去实现那个更通用的改进。这个人工步骤能防止循环退化成针对基准取巧。没有它,自我改进的智能体可能会选择为每个任务各写一个 Skill——智能体跟人类一样懒。有了它,目标就是把某个任务上的失败转化为一种能力,让它帮助我们还没见过的任务。支持这一流程的工具位于 goose 仓库的 evals/harbor 目录中。主要入口是 ./evals/harbor/cmd.py,一个小型 Python 命令,提供 runlistshowtaskcomparepull 等子命令。它将 Harbor 封装在某个特定的 goose 二进制、模型和扩展集之上,然后生成一个目录,里面放满了每个任务的 JSON 和日志。这是 Python 大显身手的地方。cmd.py 是一个 PEP 723 uv 脚本,依赖直接写在文件顶部。不需要打包流程,不需要新建仓库,也不用记住哪个虚拟环境是“被祝福”的。

查看原文