每个AI开发者都遇到过这种情况:你的应用抛出503错误,用户不断追问你,而你打开了12个浏览器标签页——OpenAI状态页面、Anthropic状态页面、GitHub Copilot健康页面、三个不同的Discord服务器——试图弄清楚这是你的问题还是他们的?这就是我们着手解决的问题。Prismix将77个AI服务的状态聚合在一个地方。经过六周的生产环境运行,我们学到了一些可能为你节省时间的经验。

Dev.to AI 2026-07-14T09:21:34.319101

问题比你想象得更严重

AI API的故障方式与传统基础设施不同。它们以奇怪、局部的方式失效:

官方的状态页面在设计上是乐观的。它们是对外沟通工具,而非实时工程仪表盘。

77个状态页面聚合后的全貌

当同时监控77个AI服务时,模式很快显现。OpenAI是最受关注的服务。模式几乎总是:调查中 → 已确认 → 监控中 → 已解决,通常在45-90分钟内。调查阶段是大多数开发者恐慌的时候——看起来糟糕,但通常无需你采取行动就会解决。

与API使用量的增长相比,Anthropic的运行明显更干净。事件更少、更短。

长尾部分很有趣。像Replicate、Runway、ElevenLabs和Suno这类服务的事件模式与OpenAI完全无关——它们是真正的独立故障域,适合用于冗余设计。

"无声降级"问题确实存在。我们多次看到某个服务显示"运行正常",而我们的正常运行时间探测却在超时。这就是为什么Prismix会为每个服务显示延迟迷你曲线——状态页面捕获已公告的事件,探测则捕获真实的事件。

Prismix 做了什么(以及为什么免费)

Prismix 从各服务的官方状态页获取数据,并补充了单个状态页所没有的信息:

它之所以免费,是因为运行在 Cloudflare 的免费套餐上(Workers + KV)。Pro 套餐($10/月)增加了邮件/Webhook 告警功能,但核心仪表盘保持免费。

技术细节

技术栈为 Astro 5 SSR + Cloudflare Workers + KV。KV 的免费套餐每天提供 10 万次读取,但仅支持 1 千次写入。每 5 分钟运行一次的状态刷新定时任务采用条件写入——仅在内容实际发生变化时才写入。这使写入量从每天约 8,400 次降到了约 600 次。监控基础设施必须运行成本低廉,否则保持免费的意愿就会消失。

我们尚不确定的事

六周下来,有些问题我们确实还没把握:

如果其中任何一点引起了你的共鸣,欢迎留言。访问 prismix.dev。Prismix 还提供了包含 500+ 个服务器的 MCP server 目录以及精选 AI 新闻源——但我们最想听到反馈的还是状态监控这一部分。

查看原文