Show HN: TTFT 基准测试:LLM Gateway 与 OpenRouter 对比(Claude-haiku-4.5,150 次运行)

每次接入 AI 网关,就相当于在应用和模型之间多跳了一步。真正关键的问题是,当用户对着空白的聊天窗口等待时,这一步要花多少时间——也就是首 token 时间(time to first token, TTFT)。大多数关于网关延迟的讨论都跳过了实际测量,光争论架构设计——所以我们亲自测了一下。
我们在同一台机器上、用同一个模型,交替对 LLM Gateway 和 OpenRouter 运行了一套开源的 TTFT 基准测试。各运行 75 次的中位数结果:LLM Gateway 在冷连接下首 content token 耗时 906ms,热连接下 814ms;OpenRouter 则是 1392ms 和 1232ms。也就是说,冷连接快了大约 35%,热连接快了大约 34%,而且 300 次实测中零错误——总共发出了 450 次 HTTP 请求(每次热连接测量前都包含一次预热请求),全部返回 HTTP 200。每次运行的原始数据已完整公开。
我们如何测量 AI 网关性能
我们用的是 ai-gateways-benchmark,这是一款由 Ronny Badilla 开发的开源脚本,最近在对比 Vercel AI Gateway、OpenRouter 和 Cloudflare AI Gateway 时被广泛使用。它只依赖 Python 标准库——用原生 socket,不借助任何 HTTP 库——并且把流式请求的每个阶段分开计时:DNS、TCP 连接、TLS 握手、TTFB(从发出请求到收到第一个响应字节)、以及 TTFT(从发出请求到 SSE 流中出现首个 content token)。
这种拆分就是关键所在。「网关延迟」的说法通常会把连接成本、边缘节点距离和实际路由开销混为一谈。这个工具把它们一一拆开了。