无人预算的令牌税——以及为何它最打击预算紧张者

Dev.to ML 2026-06-28T18:19:50.755547

大多数关于 AI Agent 的文章都在讲提示词、工具和评估。几乎没有一篇文章会提及那个在真实部署中悄然占据主导地位的费用项:你在每一次交互回合中支付的上下文令牌(context tokens)

其机制是这样的:典型的 Agent 循环会在每一步重新发送截至目前为止的整个对话历史,以便模型能够“记住”之前发生了什么。第 1 回合发送少量内容。第 20 回合则再次重新发送第 1 到第 19 回合的所有内容。在一个会话过程中,输入令牌的成本并非随完成的工作量增长——它大致随回合数呈 O(N²) 增长。

如果预算充足,你可能永远不会注意到这一点。但如果你是在内罗毕独自开发,或是在拉各斯或阿克拉的一个小团队,用硬通货支付每一个令牌,那么第一天你就会发现:账单追踪的是工作的长度,而不是它的价值。一个运行整个下午的任务,其花费可能超过它交付的功能本身——而一个需要为数千用户反复运行该循环的产品,则会在每个用户身上成倍放大同样的浪费。

在相信任何人之前——包括本文——请先自行度量

有一个开放、离线的基准测试正好能核算这一点。它模拟了一个真实编码助手的会话过程(跨越三次阶段),并在两种策略下统计输入/上下文令牌数:一种是每回合重新发送完整的对话记录,另一种是每回合只召回一个小型、有上限的记忆单元集:

git clone https://github.com/citw2/saihm-token-benchmark
cd saihm-token-benchmark && npm install
node benchmark.mjs

它完全离线运行,无需 API 密钥,使用 gpt-tokenizer(cl100k_base)进行分词。在附带的场景下,它报告使用有界召回可减少 62.8%–85.9% 的上下文令牌,并且会话运行时间越长,差距越大。修改 --recall-cap 即可观察权衡变化。关键不在于那个标题数字——而在于你可以在自己的会话中复现它,而不是听信供应商的一面之词。

解决方法:召回一个有界集合,而不是重放整个记录

那种昂贵的习惯是把整个对话当成 Agent 的内存。更经济的设计是将持久性事实——决策、约定、文件路径、你后续真正需要的东西——作为独立的记忆单元保存下来,每回合只召回一个小的、有上限的集合。这样一来,原本的平方级重发就变成了大约 O(N · cap):成本随工作量增长,而不是随记录的长度增长。

这就是 SAIHM 背后的理念——一个任何支持 MCP 的 AI 客户端都可以调用的主权记忆层。持久性事实以加密单元的形式存在,密钥由你掌握;每回合拉取一个有限的工作集,而不是重放历史。由于记忆通过开放协议进行寻址,无论你调用的是 Claude、GPT、DeepSeek、Qwen、Kimi 还是 GLM,同一个存储都可以使用——这对于那些为了追求更优单价而切换模型的用户非常有用,而预算紧张的用户必然会这样做。

为什么预算紧张的情况是最有力的论据

对于面临硬通货 API 成本的开发者来说,有两件事在叠加效应:

让记忆变得更便宜的特性,同时也让它变得可移植、可擦除:你持有密钥,一次删除可销毁该密钥并在公有链上可证明,你还可以将单条记录共享给另一个 Agent 并撤销共享。但预算问题本身就足以说明一切——抹平那条 O(N²) 曲线后,剩下的全是好处。

不花一分钱试试看

上面的基准测试是一份资源;可运行的演示则是另一份。它们让你在各大主流模型中植根于你拥有的记忆,然后证明你可以擦除它——每个演示离线运行约一分钟,无需账户

SAIHM 本身是一个付费产品,没有免费层级——提前说明,而不是藏在试用后面。但基准测试和演示是开源的,且在本地运行,因此你可以在做任何决定之前先验证这些说法并尝试集成。


独立性声明:SAIHM 是一个由第三方独立编写的 Apache-2.0 协议。它与 OpenAI、Anthropic、Google 或任何 AI 客户端供应商均无关联。基准测试是开源的,可离线复现;文中的数字由已发布的脚本生成,并取决于会话长度和场景。

查看原文