让 Agent 照看你的部署

HN Code LLM Research 2026-08-19T12:37:17.991482

部署是件吓人的事。就是那一刻,你会搞砸东西。

而不部署更吓人。等待只会让下一次部署变得更大。

俗话说:“如果疼,就多练。”

显而易见且正确的答案是持续交付(CD)。但接着你就得去构建金丝雀发布、波浪发布,还有用作闸门的自动化检测系统。金丝雀和波浪都容易,自动化检测系统却很难。可能出错的事情数不胜数,而漏掉任何一件就足以让你翻车。这种不对称,和部署之所以令人害怕,原因是一模一样的。

过去的解决方式是:投入大量工程,承受大量痛苦。于是 CD 被推迟,人类只能坐在旁边盯着部署,部署频率很低,低效、痛苦、恐惧的恶性循环周而复始。

这种情况恰恰适合用一个 Agent 来处理,而不是写一堆代码:数据丰富,可能状态多到长尾,运行次数少(一天几次,而不是每秒 100 次)。

而且我们现在随手就能拿到智能。那就用起来吧!

在 exe,Athena 负责监督我们的部署。(我们所有的 bot 都有名字,只是为了方便谈论它们。它们是程序,不是人。)

Athena 待在一个叫 “exe-ops” 的系统里,那是我们的部署指挥中心。我们一开始用 shell 脚本,后来才搭了 UI。传统做法是迁移到 Spinnaker 之类的工具;我们没有这么做,而是从 shell 脚本向上构建成我们想要的形状。Athena 就是这个故事的一部分。

这个 bot 对 git、指标和日志有读取权限。它在每个阶段做出判断:应该继续吗?下一波该包含哪些机器?它可以上报给人类处理,也可以暂停部署——如果它觉得这么做不明智,甚至可以拒绝开始部署。它通过 Slack 消息和我们沟通。

它很棒!勤勉又彻底。它会读 diff、分析日志、检查预料之外的问题,遇到怪异问题还能自愈,并且会报告怎样才能让以后的运行更顺畅。

理论上,我可能比 Athena 更擅长监督部署。但关键问题不是“理论上我能不能做得更好”,而是“现实中我是否会做得更好”。我们都很忙。实际上,Athena 做得比我现实中能做的要好得多得多。

查看原文