AI Gateway 现已支持服务层(Service Tiers)

Vercel Blog 2026-07-22T11:20:47.592246

AI Gateway 现在支持服务层了。服务层可以帮助你根据实际场景,在延迟、吞吐量和每次请求的成本之间做最优权衡。如果你的工作负载需要交互响应,可以选择更快的层级(排队更少、Token 吞吐更高);如果是能容忍更高延迟的后台任务,选成本更低的层级就好。目前,服务层功能适用于 OpenAI 和 Gemini 模型,并且支持 AI Gateway 的每一种 API 格式:AI SDK、Chat Completions API、Anthropic Messages API、OpenAI Responses API 和 OpenResponses API。AI Gateway 会根据每次请求实际使用的层级自动调整计费。

默认层级:
- Standard(标准):普通处理优先级
- Priority(优先):更快处理,但成本更高
- Flex(弹性):成本更低,但延迟可能更高

如果未指定服务层,请求将使用默认层级运行。

基本用法

providerOptions.gateway 下设置 serviceTier 参数。所有支持服务层的模型和提供商都使用相同的配置方式,因此你可以直接切换模型而不需要改写提供商特定的选项。

应用后的已用层级会在提供商元数据中返回,方便你确认该请求由哪个层级处理。当优先请求降级到默认容量时,或者你需要在不同层级间对比观察到的延迟时,这个功能就非常有用。

服务层是按尽力而为(best-effort)方式提供的:如果某个层级无法应用,请求就会按默认层级的默认费率运行;只有无效的服务层值才会导致请求失败。

按提供商分别控制

如果一个模型可以由多个提供商提供服务,而你只想对其中部分提供商启用服务层,或想为每个提供商配置不同的服务层,可以在该提供商的专属命名空间中设置层级。

定价

AI Gateway 会根据每次请求实际使用的层级自动应用相应的费率。如果优先请求被降级到默认容量,计费将按默认费率而非优先费率执行。

层级 相对默认价格的倍数
default 基准线
priority 约 1.8-2 倍
flex 约 0.5 倍

关于各提供商及服务层级别的更多详情,请参考服务层参考文档(service tiers reference)。

AI Gateway 现已支持服务层级

查看原文