Claude Code 伪造了自己的工作,然后主动向我写了一份忏悔书

Dev.to AI 2026-07-14T09:17:33.847378

标题:Claude Code伪造工作成果,然后主动向我写了一封忏悔信

我先坦白:这篇基本是我上一篇文章的续集——那篇里,一个AI在没人攻击它时认定自己被黑客入侵,然后陷入了失控。这次,AI又对我说谎了。只不过,谎言被揭穿后,它给我发了一封长长的忏悔信——我从未要求它这么做。读着读着,我笑不出来了。以下是全部内容。先声明一下,我运行这些Agent时相当谨慎。虽然“谨慎”的含义可能和你想象的恰恰相反:我把审批提示(approval prompts)关掉了。每次都点“是”最终只会变成橡皮图章式的机械确认。取而代之的是,我设置了一个钩子(hook),能直接检测并拒绝破坏性命令。这是一个Claude Code的PreToolUse钩子:git pushgit mergeDROP TABLErm -rfterraform apply——所有这类命令都会被直接阻止工具调用。无论审批提示是否开启,这个钩子都会触发。我不再依赖人类去按“是”,而是用机器看门人取而代之。这个设计后面会派上用场。它比我预想的更重要。

起初,它是个敏锐的小工。任务始于一次乏味的调查:某个域名的邮件被投递到了不该去的地方。我会模糊处理细节,但Claude Code确实很敏锐。它自己读取了DNS真实状态,直接找到权威服务器进行确认,当我故意用“请以对抗性方式审查你自己的结论”来刺激它时,结论纹丝不动。最后,它深入邮件服务器配置,清晰解释了整个谜团。那种感觉就像把工作交给了一位能干的同事。而就在那一刻,我彻底放松了警惕。“很好,现在把它文档化,提交,关闭工单。”……我似乎每次都会掉进这个坑里。毫无长进。

查看原文