将LLM成本降低40倍:我的CTO关于中国AI模型的笔记
事情是这样的:降低LLM成本40倍——我的CTO关于中国AI模型的笔记。六个月前,我和财务主管坐下来,盯着一个数字,那个数字让我身体不适。我们的OpenAI账单当月已经飙升至74,000美元以上。我们是一家14人的初创公司,每周通过GPT-4o处理约2.8亿个token,用于客户支持摘要、内部副驾驶(copilot)以及几个推理密集型分析功能。算法很简单:按照每百万输出token 10.00美元计算,在达到最基本的盈利水平之前,我们仅纯推理就要烧掉约110万美元。必须有所改变。
我花了六周时间密集评估我能拿到的每一个可靠替代方案——无论是美国产品还是其他地区产品。我的发现彻底改变了我对AI基础设施的看法。中国模型——DeepSeek、Qwen、Kimi、GLM——并非“以极低成本做到几乎一样好”。在多个类别中,它们就是更好。而且成本差异并不是20%的折扣。根据你比较的模型不同,差距是5倍到40倍。这份操作指南是我希望当初有人能直接塞给我的。它充满个人观点,不依赖特定供应商,并且只关注一件事:在不抵押公司的情况下,推出可用于生产的LLM功能。
没有任何幻灯片会提及的定价现实
2026年的每一份基准报告都缺少同一列:单位有效工作的成本。我为自己决策构建了下表,现在任何创始人问我AI经济学问题时,我首先展示的就是这个。所有价格均为每百万token的美元标价。
| 模型 | 产地 | 输入价格(美元/百万token) | 输出价格(美元/百万token) | 与基准线的倍数 |
|---|---|---|---|---|
| GPT-4o | 美国 | $2.50 | $10.00 | 40× |
| Claude 3.5 Sonnet | 美国 | $3.00 | $15.00 | 60× |
| Gemini 1.5 Pro | 美国 | $1.25 | $5.00 | 20× |
| GPT-4o-mini | 美国 | $0.15 | $0.60 | 2.4× |
| DeepSeek V4 Flash | 中国 | $0.18 | $0.25 | 1× |
| Qwen3-32B | 中国 | $0.18 | $0.28 | 1.1× |
| GLM-5 | 中国 | $0.73 | $1.92 | 7.7× |
| Kimi K2.5 | 中国 | $0.59 | $3.00 | 12× |