我们削减了40倍AI费用:一位CTO关于中美大语言模型的笔记

Dev.to ML 2026-07-05T03:04:20.615955

我想聊聊萦绕在我心头几个月的一件事:中美AI模型之间荒谬的成本不对称,以及这对任何大规模运行生产系统的人来说意味着什么。

简单介绍一下背景。我是一家小型SaaS初创公司的CTO。我们每天处理数百万个LLM(大语言模型)的token,涵盖分类、提取、摘要以及少量智能体工作流。第一年,我们所有工作都通过OpenAI运行。账单……还能接受。后来我们进入增长曲线,业务量翻倍,突然推理费用成了利润表上仅次于工资的第二大支出。那时我开始四处比价。我的发现着实让我惊讶。以下是一个现在并行运行两个技术栈的人的直言不讳。

没人愿意谈的定价现实

我们直接看原始数据,因为上下文比你想象的没那么重要:

模型 产地 输入价格 $/百万token 输出价格 $/百万token 相对V4 Flash的倍数
GPT-4o 美国 $2.50 $10.00 40×
Claude 3.5 Sonnet 美国 $3.00 $15.00 60×
Gemini 1.5 Pro 美国 $1.25 $5.00 20×
GPT-4o-mini 美国 $0.15 $0.60 2.4×
DeepSeek V4 Flash 中国 $0.18 $0.25 1× (基准线)
Qwen3-32B 中国 $0.18 $0.28 1.1×
GLM-5 中国 $0.73 $1.92 7.7×
Kimi K2.5 中国 $0.59 $3.00 12×

再读一遍。Claude 3.5 Sonnet 每个输出token的价格是 DeepSeek V4 Flash 的60倍。六十倍。这可不是笔误,也不是促销价——这是挂牌价。当我第一次把数据给联合创始人看时,他的原话是“有什么陷阱?”因为在软件行业,当一样东西便宜40倍时,通常会有隐藏成本——延迟、质量、锁定效应等等。所以我去测试了。

质量差异在大规模场景下真的重要吗?

以下是我追踪的基准测试数据,取MMLU风格推理、HumanEval代码以及C-Eval(中文)的平均值:

看看这一差距。这个组里“最好”和“最差”模型在每个基准上的差距大约都在4个点以内。对于大多数生产工作负载来说,这属于噪声级别。我们讨论的是分类器在长尾边缘案例上达到92%还是88%——在我们的流程中,这无论如何都会在下游重新验证。ROI计算显而易见。如果你能用每百万输出$3的价格替代$15,而MMLU只损失2个点,你会毫不犹豫地这么做。尤其是在规模化时,这笔费用会复利增长。

为什么这从架构层面很重要

这部分我想让其他CTO和工程负责人真正内化。差价存在的根本原因是结构性的,而非促销性的。中国实验室在开放权重可用性、API定价和吞吐量上竞争——而非美国实验室收取的那种品牌溢价。市场动态不同。对于初创公司,这转化为我现在遵循的三个架构原则:

  1. 永远不要针对单一供应商进行架构设计。 我看着账单飙升才艰难学会这一点。供应商锁定是架构的坏味道,而解决方法始终相同——将你的提供商调用包装在一个小抽象层中,这样切换只需几小时而非数周。
  2. 将每次token的成本作为可观测性堆栈中的一等指标。 我们现在为每个请求记录它及其延迟。当财务部门问预算去向时,ROI故事不言自明。
  3. 优化“以40倍更低成本达到足够好”。 前沿发展如此之快,一旦过了原型阶段,绑定到旗舰美国模型很少值得溢价。这是AI基础设施工作中枯燥但负责任的部分。也是让你的烧钱率合理的关键。

真正的壁垒:API访问

如果数据如此不平衡,为什么不是所有人都切换过来呢?以下是我花了两个星期才弄清楚的困扰所在。每家中国提供商都有同样的摩擦点:

如果你身处美国、欧盟或中国以外的任何地方,你会碰壁。不是技术壁垒——而是支付和注册壁垒。我亲身经历过。为了注册某家提供商,我不得不让一位上海的同事帮我验证支付宝。这绝非一条可以投入生产的路径。这确实是瓶颈所在,而且完全不是质量问题,而是访问问题。

是什么改变了我们的局面:Global API

一位朋友向我推荐了 Global API,此后我一直在使用它。它做的事情很直接:将所有主流中国模型包装在 OpenAI 兼容的端点后面,地址为 https://global-apis.com/v1。支持 PayPal 和信用卡支付。仅需电子邮件注册。提供英文文档。以美元计费。从架构上我最欣赏的一点是,它保留了 OpenAI 的请求格式。这意味着我之前提到的第一点中的抽象层无需任何重写——只需更改基础 URL 和模型名称即可。

以下是通过他们的端点调用 DeepSeek V4 Flash 的典型示例:

from openai import OpenAI

client = OpenAI(
    api_key="sk-global-...",
    base_url="https://global-apis.com/v1"
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a precise data extraction assistant."},
        {"role": "user", "content": "Extract invoice number, vendor, total from: INV-4421 Acme Corp $4,820.00"}
    ],
    temperature=0.1,
)

print(resp.choices[0].message.content)
# >>> invoice_number=INV-4421 vendor=Acme Corp total=4820.0

这是第4/6部分的翻译:


即插即用

openai Python SDK 无需修改即可使用,因为接口完全相同。同样的 messages、同样的 temperature、同样的响应结构。如果你已经在使用 OpenAI 集成,迁移仅需一行配置。

对于需要回退的工作负载(而且你始终应该考虑回退),我按模型进行路由:

def route_request(task_type: str, prompt: str) -> str:
    model_map = {
        "code": "deepseek-v4-flash",    # 便宜,92 HumanEval
        "chinese": "glm-5",             # 最佳 C-Eval,$1.92/M
        "reasoning": "kimi-k2-5",       # 强通用推理能力,$3/M
        "fast": "qwen3-32b",            # 1.1× V4 Flash,非常强大
    }
    chosen = model_map.get(task_type, "deepseek-v4-flash")
    resp = client.chat.completions.create(
        model=chosen,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

以我们的用量来看,即便是“最贵”的中国模型(Kimi K2.5,输出价格 $3.00/M)仍然比 Claude 3.5 Sonnet 便宜 5 倍。仅路由逻辑一项,就比我们之前为同等任务支付给 OpenAI 的费用节省了约 60%。

关键对比

以下是我严格筛选的、实际评估用于生产的对比:

DeepSeek V4 Flash vs GPT-4o。 V4 Flash 在价格上胜出 40 倍,速度也更快(60 tok/s vs 50 tok/s)。GPT-4o 在视觉处理以及那些“感觉”更好的边缘场景提示上占优——大约占我们流量的 3%。两者均支持 128K 上下文窗口。对于大规模纯文本工作负载,V4 Flash 是答案。我将 GPT-4o 放在路由检查之后,用于视觉任务以及作为超难提示的回退。

Qwen3-32B vs GPT-4o-mini。 Qwen 更便宜(输出价格 $0.28/M vs $0.60/M),在通用质量、代码和中文方面得分更高,而且根据我的经验运行速度更快。在 2026 年,我没有任何场景会选用 GPT-4o-mini 而非此模型。绝对没有。它是我做的第一个替换。

Kimi K2.5 vs Claude 3.5 Sonnet。 Kimi 价格便宜5倍,每百万token输出$3.00,而Claude为$15.00。推理质量基本持平。在中文上Kimi碾压Claude(Kimi是Moonshot AI的产品——他们深耕中文)。对于纯英文工作负载,如果不需要Claude特有的“怪癖”,Kimi K2.5就是最佳选择。

GLM-5 自成一派。 每百万token输出$1.92,比V4 Flash贵,但比美国中端模型便宜,并且在我追踪的C-Eval分数中表现最佳(91.0)。我专门用它处理中英混合的文档工作,这类任务token量适中。

生产环境有哪些担忧?

我担心过几件事,以及实际表现如何:

给同行的最终建议

中美模型之间的质量差距现在已经足够小,你可以根据工作负载和成本进行路由,而不必牺牲输出质量。在规模化时,价格差异是结构性优势,而非临时折扣。如果你为所有输出token支付$15/百万,那么你正在浪费大量预算。

我们削减了40倍AI账单:一位CTO关于中美大语言模型的笔记

查看原文