我们削减了40倍AI费用:一位CTO关于中美大语言模型的笔记
我想聊聊萦绕在我心头几个月的一件事:中美AI模型之间荒谬的成本不对称,以及这对任何大规模运行生产系统的人来说意味着什么。
简单介绍一下背景。我是一家小型SaaS初创公司的CTO。我们每天处理数百万个LLM(大语言模型)的token,涵盖分类、提取、摘要以及少量智能体工作流。第一年,我们所有工作都通过OpenAI运行。账单……还能接受。后来我们进入增长曲线,业务量翻倍,突然推理费用成了利润表上仅次于工资的第二大支出。那时我开始四处比价。我的发现着实让我惊讶。以下是一个现在并行运行两个技术栈的人的直言不讳。
没人愿意谈的定价现实
我们直接看原始数据,因为上下文比你想象的没那么重要:
| 模型 | 产地 | 输入价格 $/百万token | 输出价格 $/百万token | 相对V4 Flash的倍数 |
|---|---|---|---|---|
| GPT-4o | 美国 | $2.50 | $10.00 | 40× |
| Claude 3.5 Sonnet | 美国 | $3.00 | $15.00 | 60× |
| Gemini 1.5 Pro | 美国 | $1.25 | $5.00 | 20× |
| GPT-4o-mini | 美国 | $0.15 | $0.60 | 2.4× |
| DeepSeek V4 Flash | 中国 | $0.18 | $0.25 | 1× (基准线) |
| Qwen3-32B | 中国 | $0.18 | $0.28 | 1.1× |
| GLM-5 | 中国 | $0.73 | $1.92 | 7.7× |
| Kimi K2.5 | 中国 | $0.59 | $3.00 | 12× |
再读一遍。Claude 3.5 Sonnet 每个输出token的价格是 DeepSeek V4 Flash 的60倍。六十倍。这可不是笔误,也不是促销价——这是挂牌价。当我第一次把数据给联合创始人看时,他的原话是“有什么陷阱?”因为在软件行业,当一样东西便宜40倍时,通常会有隐藏成本——延迟、质量、锁定效应等等。所以我去测试了。
质量差异在大规模场景下真的重要吗?
以下是我追踪的基准测试数据,取MMLU风格推理、HumanEval代码以及C-Eval(中文)的平均值:
- 通用推理(MMLU系列):GPT-4o: 88.7 / Claude 3.5 Sonnet: 89.0 / Kimi K2.5: 87.0 / DeepSeek V4 Flash: 85.5 / GLM-5: 86.0 / Qwen3.5-397B: 87.5
- 代码(HumanEval):Claude 3.5 Sonnet: 93.0 / GPT-4o: 92.5 / DeepSeek V4 Flash: 92.0 / Qwen3-Coder-30B: 91.5 / DeepSeek Coder: 91.0
- 中文(C-Eval):GLM-5: 91.0 / Kimi K2.5: 90.5 / Qwen3-32B: 89.0 / GPT-4o: 88.5 / DeepSeek V4 Flash: 88.0
看看这一差距。这个组里“最好”和“最差”模型在每个基准上的差距大约都在4个点以内。对于大多数生产工作负载来说,这属于噪声级别。我们讨论的是分类器在长尾边缘案例上达到92%还是88%——在我们的流程中,这无论如何都会在下游重新验证。ROI计算显而易见。如果你能用每百万输出$3的价格替代$15,而MMLU只损失2个点,你会毫不犹豫地这么做。尤其是在规模化时,这笔费用会复利增长。
为什么这从架构层面很重要
这部分我想让其他CTO和工程负责人真正内化。差价存在的根本原因是结构性的,而非促销性的。中国实验室在开放权重可用性、API定价和吞吐量上竞争——而非美国实验室收取的那种品牌溢价。市场动态不同。对于初创公司,这转化为我现在遵循的三个架构原则:
- 永远不要针对单一供应商进行架构设计。 我看着账单飙升才艰难学会这一点。供应商锁定是架构的坏味道,而解决方法始终相同——将你的提供商调用包装在一个小抽象层中,这样切换只需几小时而非数周。
- 将每次token的成本作为可观测性堆栈中的一等指标。 我们现在为每个请求记录它及其延迟。当财务部门问预算去向时,ROI故事不言自明。
- 优化“以40倍更低成本达到足够好”。 前沿发展如此之快,一旦过了原型阶段,绑定到旗舰美国模型很少值得溢价。这是AI基础设施工作中枯燥但负责任的部分。也是让你的烧钱率合理的关键。
真正的壁垒:API访问
如果数据如此不平衡,为什么不是所有人都切换过来呢?以下是我花了两个星期才弄清楚的困扰所在。每家中国提供商都有同样的摩擦点:
- 支付: 仅支持微信/支付宝
- 注册: 需要中国手机号
- 地域限制: API 经常屏蔽非中国 IP
- 文档: 主要是中文
- API 格式: 有些使用兼容 OpenAI 的端点,有些则不是
如果你身处美国、欧盟或中国以外的任何地方,你会碰壁。不是技术壁垒——而是支付和注册壁垒。我亲身经历过。为了注册某家提供商,我不得不让一位上海的同事帮我验证支付宝。这绝非一条可以投入生产的路径。这确实是瓶颈所在,而且完全不是质量问题,而是访问问题。
是什么改变了我们的局面:Global API
一位朋友向我推荐了 Global API,此后我一直在使用它。它做的事情很直接:将所有主流中国模型包装在 OpenAI 兼容的端点后面,地址为 https://global-apis.com/v1。支持 PayPal 和信用卡支付。仅需电子邮件注册。提供英文文档。以美元计费。从架构上我最欣赏的一点是,它保留了 OpenAI 的请求格式。这意味着我之前提到的第一点中的抽象层无需任何重写——只需更改基础 URL 和模型名称即可。
以下是通过他们的端点调用 DeepSeek V4 Flash 的典型示例:
from openai import OpenAI
client = OpenAI(
api_key="sk-global-...",
base_url="https://global-apis.com/v1"
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a precise data extraction assistant."},
{"role": "user", "content": "Extract invoice number, vendor, total from: INV-4421 Acme Corp $4,820.00"}
],
temperature=0.1,
)
print(resp.choices[0].message.content)
# >>> invoice_number=INV-4421 vendor=Acme Corp total=4820.0
这是第4/6部分的翻译:
即插即用
openai Python SDK 无需修改即可使用,因为接口完全相同。同样的 messages、同样的 temperature、同样的响应结构。如果你已经在使用 OpenAI 集成,迁移仅需一行配置。
对于需要回退的工作负载(而且你始终应该考虑回退),我按模型进行路由:
def route_request(task_type: str, prompt: str) -> str:
model_map = {
"code": "deepseek-v4-flash", # 便宜,92 HumanEval
"chinese": "glm-5", # 最佳 C-Eval,$1.92/M
"reasoning": "kimi-k2-5", # 强通用推理能力,$3/M
"fast": "qwen3-32b", # 1.1× V4 Flash,非常强大
}
chosen = model_map.get(task_type, "deepseek-v4-flash")
resp = client.chat.completions.create(
model=chosen,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
以我们的用量来看,即便是“最贵”的中国模型(Kimi K2.5,输出价格 $3.00/M)仍然比 Claude 3.5 Sonnet 便宜 5 倍。仅路由逻辑一项,就比我们之前为同等任务支付给 OpenAI 的费用节省了约 60%。
关键对比
以下是我严格筛选的、实际评估用于生产的对比:
DeepSeek V4 Flash vs GPT-4o。 V4 Flash 在价格上胜出 40 倍,速度也更快(60 tok/s vs 50 tok/s)。GPT-4o 在视觉处理以及那些“感觉”更好的边缘场景提示上占优——大约占我们流量的 3%。两者均支持 128K 上下文窗口。对于大规模纯文本工作负载,V4 Flash 是答案。我将 GPT-4o 放在路由检查之后,用于视觉任务以及作为超难提示的回退。
Qwen3-32B vs GPT-4o-mini。 Qwen 更便宜(输出价格 $0.28/M vs $0.60/M),在通用质量、代码和中文方面得分更高,而且根据我的经验运行速度更快。在 2026 年,我没有任何场景会选用 GPT-4o-mini 而非此模型。绝对没有。它是我做的第一个替换。
Kimi K2.5 vs Claude 3.5 Sonnet。 Kimi 价格便宜5倍,每百万token输出$3.00,而Claude为$15.00。推理质量基本持平。在中文上Kimi碾压Claude(Kimi是Moonshot AI的产品——他们深耕中文)。对于纯英文工作负载,如果不需要Claude特有的“怪癖”,Kimi K2.5就是最佳选择。
GLM-5 自成一派。 每百万token输出$1.92,比V4 Flash贵,但比美国中端模型便宜,并且在我追踪的C-Eval分数中表现最佳(91.0)。我专门用它处理中英混合的文档工作,这类任务token量适中。
生产环境有哪些担忧?
我担心过几件事,以及实际表现如何:
- 延迟。 每秒token数大致相当。V4 Flash的吞吐量实际上超过了GPT-4o(我的测试中分别为60 tok/s vs 50 tok/s)。端到端p95延迟更多取决于路由和请求大小,而非提供商选择。
- 可靠性。 通过Global API的端点,三个月内我没有遇到明显的停机。美国供应商有着更好的原始SLA和历史记录——这是事实。但“以1/40的成本获得足够好的正常运行时间”才是实际的权衡。
- 供应商锁定。 通过抽象层解决。我们可以在一个小时内切换供应商。兼容OpenAI的接口意味着我们拥有更多选择,而非更少。
- 数据驻留。 请阅读每家供应商的条款。Global API以美元计费,并通过其指定的任何路线处理数据。对于大多数初创公司来说,这不成问题。如果你身处受监管行业,显然需要深入调查。
给同行的最终建议
中美模型之间的质量差距现在已经足够小,你可以根据工作负载和成本进行路由,而不必牺牲输出质量。在规模化时,价格差异是结构性优势,而非临时折扣。如果你为所有输出token支付$15/百万,那么你正在浪费大量预算。