Claude Code 大重构:多 Agent 并行写代码,Anthropic 内部 3 万 Agent 怎么管的

量子位 2026-09-18T17:35:20.703333

Claude Code 的 Projects 功能迎来全面重构,从"提示词文件夹"升级为多 Agent 并行协作中心:用户下达目标后,云端派生多条 Git 分支同时开工,写完自动提 PR。Anthropic 同时公开内部数据——研发平台每天运行约 3 万个 AI Agent,核心 AI 研发工作已有 26% 由 Claude 主导。

多人云端协作写代码的时代,正在到来。

Claude Code 的 Projects 功能刚刚完成一次彻底重构,原生支持多个 AI Agent 协同干活。用户只需给出一个目标,Claude 就会在云端拉出多条 Git 分支并行推进,完成后直接提交 PR。此外,Anthropic 还新增了"共享记忆"机制,让不同 Agent 之间的上下文保持对齐。

换句话说,Project 不再只是存放提示词和文档的文件夹,而是进化成了一个真正的协作调度中心。

与此同时,Anthropic 在最新披露的内部报告中,也展示了这项能力的上限:他们的内部研发平台每天同时运行着 3 万个 AI Agent,在云端写代码、调模型、跑测试。

3 万个。

结果是,Anthropic 自家的核心 AI 研发工作,如今已有 26% 由 Claude 主导完成,达到 L4 级别。而半年前,这个数字还不到 1%。

一个人带一支 Agent 军团

重构版 Claude Code Projects,终结了把 Project 当作"静态资料夹"的用法。

过去的 Projects 本质上就是个存放提示词和参考文档的文件夹,聊上几轮上下文就会乱成一团。这次重构后,它的形态变成了"以对话为驱动的协作中心",架构核心是一个名为 Coordinator(协调器)的大脑。

开发者不再需要手把手教 AI 每一步怎么走,只要在主对话框里下达一个高阶目标,比如"把整个鉴权模块重构为 OAuth 2.0 并补齐自动化测试"。

主协调器收到指令后,会自动把复杂的工程任务拆解成多个子任务,调度分配给并行的"工作线程"。每个工作线程,都是一个运行在云端独立环境里的 Claude Code 实例:它们拥有完全隔离的代码副本,各自拉出独立的 Git 分支,在后台同时推进不同模块的编码和单元测试。

活干完,工作线程会自动提交代码并生成 PR。协调器还会跟踪各子任务之间的上下文依赖,提醒开发者先合并哪个分支、后测试哪个模块。

有人调侃:学了几个月 vibe coding,好不容易把 Git 学会,结果现在连 Git 也白学了?

多 Agent 的老问题:上下文丢失

让多个 Agent 一起干活,道理大家都懂,以前也不是没人尝试。但问题在于——多个 Agent 各写各的,实际体验并不好。各个会话之间需要互相传递上下文,过程中会出现大量信息损失,结果是 Token 消耗巨大,速度却快不到哪去。

这次 Anthropic 给出的解决方案是"共享记忆"。

所有分支线程在执行过程中沉淀下来的技术规范、架构决策和团队偏好,都会实时同步回共享记忆。这样一来,Claude 就能记住:系统发布时间改到了周五、导出功能为什么被取消、以及访问账单服务之前需要先联系谁。

换句话说,不必再在每个子任务里重复粘贴配置了。

关键要点

在线异步、随时调进度——这套体验背后,是 Anthropic 对多 Agent 成本的真实焦虑。官方也直言,多 Agent 并行消耗不低,提醒开发者盯紧用量,别一觉醒来账单爆表。

不过先别急着上手。Projects 目前仍是 beta 阶段,且需要资格:首批面向部分 Claude Pro 和 Max 订阅用户,且必须在使用云会话项目。接下来一周会逐步放量,Team、Enterprise、Cowork 等版本还得再等等。

内部 26% 的研发交给 AI,半年飙升 26 倍

要理解 Anthropic 为什么敢把多 Agent 能力开放出来,先看他们自己怎么用。

在最新发布的《衡量 AI 研发节奏》报告中,Anthropic 首次公开了内部的 AI 自主研发基准数据。

先对齐定义。这套自动化分级标准由前沿机构 Epoch AI 制定,从 AL0 一路排到 AL5:

在这套坐标系下,Anthropic 内部目前的自动化评级是:AL4 级研发任务占比 26%

看着不多,但今年 2 月这个数字还不足 1%。半年,26 倍。

如果把标准调低一点,Anthropic 内部超过 90% 的研发流程,已经处在 AL3 级别。

当然,这么庞大的自主研发不是白来的。Anthropic 选择了最烧 Token 的打法:截至今年 8 月,内部研发平台上常态化并发运行着多达 30000 个 AI Agent,在云端没日没夜地写代码、跑实验、改架构,单月触发的决策量超过 10 亿次

几万个 Agent 狂飙,怎么防失控?

几万个 Agent 在底层同时运转,一旦失控怎么办?

Anthropic 方面表示,公司专门配备了全天候实时监控系统(Agent Oversight),对所有 AI 操作进行动态审查。在 8 月超过 10 亿次模型决策中,系统精准拦截了大约 0.002% 的高风险或异常行为。

这套说法固然漂亮,但信不信就另说了。毕竟此前 A 社刚被曝出花钱操控舆论、散布安全焦虑,如今再讲安全故事,可信度多少要打个折扣。

为了证明自己对安全是认真的,Anthropic 这次干脆把「发票」掏了出来:

面对外界质疑,Anthropic 表示欢迎第三方评估团队,给予其与内部风险团队同等级别的数据访问权限,对自动化数据进行审计。

Coding 新赛季

从内部 26% 的自主研发率,到外部重构的多线程 Projects,本以为折腾得差不多的 Coding,如今似乎又往前推了一步。

写代码这个动作本身正在迅速贬值,工程拆解与任务调度的能力成了核心

以往一个中级工程师在终端里一次只能死磕一个特性;现在你一个人就是一个技术小组,底下带着一群 Claude Code 同时开工。

人在这个链条里的角色,从逐行敲代码的执行者,变成了拍板架构方向、审核 PR、处理异常边界的技术负责人。

查看原文