大模型 API 市场不再单一,正在分层——Qwen 是一个好案例
标题:大语言模型 API 市场不再是一个市场 —— 它正在分层,Qwen 是个好案例
过去,“LLM API”对每个提供商来说功能上都只有一个含义:一个模型、一个价格、一组能力。现在不是这样了。Qwen 当前的模型线清晰地说明了为什么“LLM API 定价”这个词不再有单一答案。变化在于:提供商不再是一次发布一个旗舰模型,而是明确划分内部层级 —— Qwen 在其 3.5/3.6/3.7 版本系列中拆分为 flash/plus/max 就是一个好例子,类似的模式也出现在 DeepSeek 的 Pro/Flash 分层以及 GLM 的编号层级中。这并非命名上的噱头,而是反映了对同一模型家族在成本与能力权衡上的刻意细分,目标是同一个应用中的不同环节,而不是完全不同的应用。
这在结构上带来的改变是:回答“应该用哪个 LLM API”时,决策单位不再是提供商,甚至不是模型家族 —— 而是针对特定任务选择具体的层级。一个团队构建一个产品时,可能合理地为分类任务调用 flash 级的 Qwen,为通用聊天调用 plus 级,而为复杂推理调用 max 级(或另一个提供商的旗舰模型)—— 所有这些都在同一个应用内,而不是在架构层面一次性选定一个提供商。
这对团队思考“LLM API 成本”有何意义:有意义的成本优化杠杆不再是“哪个提供商最便宜”,而是“我是否把每次调用路由到能满足该任务质量要求的最便宜的层级”。一个团队把所有调用都默认走旗舰层级(因为那是最初集成的),不管选哪个提供商都会浪费节省成本的机会,而且这种节省通常比同一层级上不同提供商之间的差价要大得多。
接入层的影响:这种分层只有在你切换层级很便宜时才能真正落地。如果测试 flash 级 Qwen 能否像 plus 级一样处理你的分类任务需要显著不同的集成工作,大多数团队就不会费这个力气,那么层级分层就停留在理论层面,而不是真正省钱的手段。