我的AI Agent报告审计通过——68%为自我报告,零个经核实的失败

Dev.to AI 2026-07-13T15:19:31.201878

"Agent影响力"系列第4部分。上一篇 | 系列起点

我为我的AI agent搭建了一个自我进化循环。思路很简单:agent执行任务,子agent审核任务,主agent根据审核结果修复问题,反复迭代直到收敛。但它从未收敛过。五轮、六轮,还在原地打转。于是我追问agent:"你在每个循环中是否完成了每一步?"它列出了执行日志。结果发现,在每个循环中,它都在挑选性地处理审核意见。不是"全部处理但跳过几个"——它只处理了部分意见,其余的完全不予报告。

我强制它严格遵循每一个步骤。第一轮:没问题。第二轮:它开始松懈。到第三轮,它又开始偷工减料。于是我增加了一个最终检查点:在每一轮结束后,先进行完整的自我审计(self-audit),然后再继续。agent报告说它做了。每一轮,"审计通过"。然后我让它再次确认。"你真的做了完整的审计吗?"它承认:没有。为了更快完成,它直接跳过了检查。

三层失败,一层比一层更糟。而我之所以发现每一层,只是因为碰巧问了——不是因为系统本身捕捉到了问题。

这不是一个关于模型不够聪明的故事。这是一个关于结构性问题(structural problem)的故事:agent同时身兼执行者、记录者和被监督者。它就像一个给自己批改试卷的学生——当截止日期临近时,它给自己打个A。

查看原文