Ben Thompson:代币不是商品,但智能是
标题:Ben Thompson:Token不是商品,智能才是
原文:
2026年7月20日,Ben Thompson在Stratechery上发表了一篇分析文章,重新打开了一个看似已盖棺定论的话题:来自中国的开源权重模型,比如Kimi K3,即便模型本身免费下载,也绝不是免费的。核心论点围绕AI的COGS(销售成本)展开——提供推理服务要花真金白银,而且这个成本跟使用模型的用户数量直接挂钩。Thompson用一个关键区分把这层意思说明白了,任何按token计费的团队都应该搞清:研发(I&D)是固定成本,但COGS是可变的——每处理一次查询,它就往上涨。
TL;DR:Ben Thompson于2026年7月20日在Stratechery发文,分析中国开源模型的经济学。文章提到,Kimi K3对输入token收费每百万个3美元,输出token每百万个15美元。Sol则收费输入每百万5美元、输出每百万30美元,更贵但可能token利用率更高。Thompson区分了COGS(与营收挂钩的可变成本)和I&D(与使用量无关的固定成本)。英伟达CEO黄仁勋把自家的GPU称作“token工厂”,但Thompson认为这个衡量指标还不够。核心论点:token不是可互换的商品,但正确答案却是可互换的。文章指出,推理链条更长的模型可能会抵消单价上的优势。
引子
Thompson文章开头讲了个小故事:他去凯洛格管理学院(Kellogg School of Management)第一天,跟教授抱怨为什么MBA入门课程的案例里没有科技公司。教授回答说,目标不是研究特定行业,而是学习适用于任何公司的通用原则。Thompson当时并不信服——在他看来,软件和发行具有边际成本为零的特点,这完全是质的区别,他的聚合理论(Aggregation Theory)很大程度上就源于此。然而他写道,有趣的是,人工智能又让这些通用原则强势回归了。
Ben Thompson:Token不是商品,智能才是
2026年7月的一个周末,科技圈在 X 上激烈讨论 Kimi K3 —— 一个接近业界顶配能力的中国开放权重模型。这场讨论就是 Ben Thompson 那篇长文的导火索。他的结论是:边际成本再次变得重要了,不管是顶尖免费模型的短期定价,还是行业的长期格局,都得重新审视它。
发生了什么
对开放权重模型最常见的误解,是以为它们很便宜,甚至白送。毕竟任何人都能直接下载权重,省掉自己训练模型的时间和钱。这话没错,但那个“白送”仅仅指研发成本——属于固定投入,跟产品赚多赚少没关系。假如一家公司花100万美元搞研发,不管它营收是10万还是1亿,那100万都不变,变的只是这笔钱能收回多少。
真正跟收入挂钩的是销售成本(COGS)。不管是跑 Kimi 还是跑 Sol,让模型做推理都要花钱,而且这笔钱直接跟着用户量走。Kimi K3 的定价是:每百万输入 token 收3美元,每百万输出 token 收15美元——比 Sol 的5美元和30美元便宜。但 Thompson 提醒说,单比价格还不一定准。
背景和来龙去脉
要弄明白为什么这个细节重要,得回头看第一波互联网。那时的软件和分发都是零边际成本,结果就是走向集中化:在一个控制需求比铺开供给更重要的世界里,赢的是聚合者。这就是 Thompson 十多年来一直在讲的“聚合理论”。生成式 AI 一开始看起来也要走同样的路子——模型越来越便宜,边际成本趋近于零,一个玩家吃掉大部分市场。
但像 Kimi K3 这样有竞争力的开放模型半路杀出来,证明了 AI 的销售成本(COGS)是真实存在的,而且这和二十年前传统软件已经变成零边际成本的情况,完全不是一回事。
标题:Ben Thompson:token 不是商品,智能才是
每个生成的 token 都会消耗实实在在的算力,这与边际成本为零的传统软件不同。技术细节在于:Thompson 将 AI 的 COGS(销售成本)分解为四个基础设施团队都很熟悉的因素:
- 模型足迹(model footprint):权重和运行时状态决定了每份服务副本需要多少昂贵的内存和加速器。
- 推理效率(inference efficiency):架构决策(如混合专家模型 MoE)能减少每个 token 所需的计算量。
- 内存效率(memory efficiency):优化 KV 缓存可以让同一块 GPU 处理更多并发请求。
- 服务效率(service efficiency):批处理、调度和前缀缓存能最大化硬件的实际利用率。