Aider、Claude Code、OpenClaw 跑同一个模型,Token 用量相差 70 倍

HN Claude Code Adoption 2026-09-02T07:13:57.569737

Aider、Claude Code、OpenClaw 跑同一个模型,Token 用量相差 70 倍的题图

团队评估 AI 编程智能体时,通常把目光集中在模型上。但最近三项基准测试表明,驾驭模型跑任务的中枢框架(harness)——也就是那层软件——可能同样关键。

原因做 Web 开发的读者都很熟悉:每次推理请求都需要上下文。相关历史要么得重新喂给模型,要么由服务系统现场重建。结果就是,服务提供方每一轮都要处理大段彼此重叠的文本,其中还包括中枢的系统提示词和工具描述。

6 月,一个独立基准测试用同一个模型,在 12 个 Python 任务上对比了 12 种配置。8 月,Composio 用 DeepSeek V4 Flash 在 30 个企业工作流上比较了 8 套中枢框架。与此同时,Artificial Analysis 也在它的编程智能体指数里持续追踪「中枢 + 模型」的组合表现。

三项基准测试各自测了什么

Composio 报告的 30 个工作流覆盖 Airtable、Gmail、Google Calendar、Google Sheets、GitHub、Slack 和 PostHog。每个任务限时 900 秒。最终结果由程序化校验器(programmatic verifier)判定,而不是用 LLM 评审,校验时使用了隔离的测试夹具,里面预置了诱饵数据和极相似的键。

Composio 一共做了 240 次运行,其中 129 个工作流成功完成。每个成功任务的平均成本,最低的是 Pi Agent 的 0.028 美元,最高的是 Claude Code 的 0.195 美元。DeepAgents 的通过率与 Claude Code 完全一致,但每次成功的成本只有后者的四分之一。

这次测试的对照组并不完美,Composio 也如实披露了:Pi 在两个模型提供方上用了不同的推理设置,Prime Agent 在 30 次运行里只产生了 24 次可评分的轮次。这些前提条件决定了,这不能看作一次严格的单变量对照实验。

六月的基准测试衡量的是 token 而非美元,差距也因此被拉得更大。作者报告了 Aider、Claude Code、Codex、Goose、Hermes、Kilo、Kimi Code、Nanobot、OpenClaw、Opencode 和 Qwen Code 的运行结果,其中 Aider 的架构师模式单独计数。全部十二种配置都通过 OpenRouter 在相同的任务上运行,因此每个框架面对的都是同一个 API、同一个模型。这套测试先跑在 DeepSeek V4 Flash 上,随后又跑上 Nvidia 的 Nemotron 3 Ultra。后一个模型在 OpenRouter 上提供免费额度,所以你可以零成本地重新跑一遍。

帖子里报告了每个已解决问题消耗的 token 数:最低是 Aider 架构师模式的大约 3,500 个,最高是 OpenClaw 的 292,000 个。这个范围之所以可用,是因为它足够稳定——在两个互不相关的模型之间,排序几乎没有变化。这指向的是框架软件,而不是模型行为。

Artificial Analysis 用更强的统计权重来回答同一个问题。它发布了一个综合指数,融合了 DeepSWE、Laude 研究所的 Terminal-Bench v2.1 和 Scale AI 的 SWE-Atlas-QnA,合计 326 个任务,每个任务跑三次取通过率平均值。它对每一对组合都报告每任务成本、token 用量和墙钟时间,还发布了一组对照实验:固定 Claude Opus 4.7 不变,在 Claude Code、Cursor CLI 和 Opencode 之间切换。

启动税

从根源上看,这种差距来自一个单一度量:六月基准测试中的“启动税”。在提示词开始做任何工作之前,框架先要背上自己的包袱——系统提示词、工具描述和环境配置。基准测试报告显示,Aider 架构师模式约 700 个 token,而 OpenClaw 约 26,000 个。

如果这 40 倍的开销只付一次还能接受,但重复发送的模式让情况变得更糟。作者指出,一个带着 26,000 token 底座的框架跑完十五轮对话,仅脚手架就要花掉大约 390,000 个输入 token。

这套数学规律在实测中站得住脚。用启动开销(startup tax)乘以轮数,就能预测每个已解决任务的 token 消耗,两个模型上的 R² 都达到了 0.99。想削减 agent 支出的开发者,应该先盯住 prompt 的下限成本和轮数,再去碰更复杂的优化手段。

不过这个回归结果有一个保留意见:六月基准测试对每种 harness、任务和模型的组合只跑了一遍,没有方差估计,而 agent 运行本身是随机的。Artificial Analysis 的数据在这方面更有分量——它在 326 个任务上每个任务平均跑三次。所以,六月的开销结论更适合当作理解机制的佐证,更大的指数才是对比当前生产规模组合的更可靠标尺。

开销高的框架并不是在囤积上下文,只是它们的基础成本更重。

真正让人意外的是,什么因素解释不了这个差距。所有框架的上下文增长速率都差不多,每轮增加几百个 token,所以增长本身并不是拉开差距的原因。开销高的框架并不是在囤积上下文,只是它们的基础成本更重。

缓存 token 重新洗牌了排行榜

两组框架实验同时指向了第二个机制,Artificial Analysis 在方法学里也把它当作实质因素。这也是团队最容易搞错的一点。

Composio 公布的数据显示,Claude Code 的输入 token 只有 1.5% 来自缓存,而 Codex 大约是 70%,OMP 是 57%。新鲜输入的价格大约是缓存输入的 5 倍。因此,Claude Code 的 token 消耗量与对手旗鼓相当,但账单金额却完全是另一回事。

六月基准测试在自己的实验配置里也发现了类似的不对称。在 DeepSeek 那一轮运行中,Codex 整个测试套件计费超过一百万个 token,其中 77% 是缓存读取,按正常费率的大约十分之一计费。按真实账单的方式计价,Codex 每个已解决问题的花费反而比 Claude Code 更低——后者消耗的原始 token 只有 Codex 的一半。

作者把 Claude Code 接近零的缓存占比归因于服务路径,而不是它的提示词写法。在那个测试环境里,Claude Code 是唯一通过 Anthropic 风格 messages 端点与 OpenRouter 通信的框架。网关对这种协议方言的转换,似乎让同等流量本可在 OpenAI 风格端点下获得的缓存命中率打了折扣。网关行为会变,所以这只能算作一条被观测到的路径。

Artificial Analysis 是把这条假设直接写进成本模型的,而不是事后才发觉。它提醒说,提示词缓存的命中率会随供应商路由的不同出现很大波动。它的成本模型把缓存输入和缓存写入分开计价,而不是把所有提示词 token 都按未命中的费率来收。一个基准测评需要单独为缓存写入定价,这本身就是在告诉开发者:服务路径的影响有多大。

重框架的成本花在了哪里

解释成本差距,不等于要给最便宜的框架封王。「观察—行动—检查—重试」这个智能体循环本身就是成本放大器。它最擅长处理陌生代码、失败的测试,以及横跨多个文件的改动。而面对一个小巧、描述清晰的编辑任务,这个循环大多只是把单次调用本可推断出的结论再确认一遍。

但困难任务的测试结果,并没有顺着「脚手架」论证预测的方向走。四个成本区间各异的框架,在宽松限额下各跑了十个 SWE-bench Lite 任务,结果四个框架都只解出了同一个任务。作者报告称,Aider 用了 80 万 token,而 Codex 花了 1500 万 token。单个模型、十个任务,样本太薄,不足以撑起泛化结论,只能当作参考。

至于「框架定了价格」这套说法,在质量面前也需要打折扣,因为基准测试并不支持它。Composio 报告了八个框架的通过率,从 OpenCode 的 46.7% 到 Pi Agent 的 66.7%,同一模型上拉开了 20 个百分点。Artificial Analysis 在更大的任务集上也发布了类似的差距。选择框架,成本是成倍地变,任务成功率却只动几个百分点——这是量级之别,不是方向之别。

平台团队该衡量什么?

企业已经开始发现,光掌握框架本身并不能解决成本问题。凡是自建编码智能体的团队,仍然要为基础模型的推理付费。成本控制的重点,已经从模型合约转移到了平台层。

衡量每次成功任务的成本,而不是每次任务的成本

如果把通过率和 token 数量分开来看,会得出错误的框架排名。Claude Code 和 DeepAgents 完成了同样多的 Composio 工作流,但 Claude Code 成功运行一次的成本超过对方四倍。采购团队应当以「经验证结果的单次成本」为准,拒绝按 token 单价进行比较。

缓存折扣并不是由框架单独决定的,它取决于端点的协议方言、网关以及模型供应商。平台团队用一下午就能在自己流量上验证缓存命中比例,这项验证比迁移模型更有价值。

负载下的提示词保真度

六月份的基准测试在每个任务前注入了 10 万个 token 的无关日志噪声,并观察到了五种不同行为。十二种配置中,有七种忠实传完了提示词;Kilo 和 Opencode 丢掉了其中 83%–89% 的内容,却仍然报告执行成功。

静默截断是最危险的,因为它在框架输出中看起来完全像是成功。

OpenClaw 拒绝运行,Kimi Code 直接崩溃,Claude Code 把内容全部传出,但执行效果不佳。静默截断是最危险的,因为它在框架输出中看起来完全像是成功。

接下来会怎样

Anthropic、OpenAI、Google 和 Microsoft 在如何为框架层收费的问题上已经分道扬镳。DeepSeek 随后以 MIT 许可证开放了自身运行时(runtime)的每个组件,全都可以替换。现在,开发者可以在一个公开且持续更新的索引中,对比不同的「框架 + 模型」组合。最初模型定价之所以能被放到台面上争论,靠的正是这种条件。

标题:Aider、Claude Code 和 OpenClaw 跑的是同一个模型,Token 用量却差了 70 倍。

这个季度如果企业要统一选型 agent 平台,那么框架(harness)的选择,应该和模型选择一样认真对待。在这些实验里,模型本身的表现基本稳定,但框架选型带来的成本差距,已经大到足以跟不同模型之间的定价差异相提并论。现在,开发者、平台团队和财务负责人总算有了可以复现的数据作为争论依据——这在三个月前,还不够格成为聊框架的素材。

查看原文