Hey HN – Metrx:给 AI Agent 打的绩效分,帮它看懂自己值不值钱
过去用人得靠绩效评估,现在用 AI Agent,同样存在“看不见的黑箱”。我之前付钱给 11 个 Agent,却完全不知道它们干得怎么样——没有任何问责机制。
Metrx 就是来解决这个问题的。它是一个 MCP 服务器,横跨 10 个领域,内置 23 个工具,能给每个 Agent 出一张“记分卡”——类似财务报表里的损益表(P&L),一边是成本,一边是产出。Agent 可以用它:
- 查自己的 ROI(成本 vs 通过 Stripe/HubSpot 或通用 webhook 归因的收入)
- 看自己的绩效等级(A+ 到 F),和其他 Agent 比较
- 收到优化建议(比如换模型、减少浪费)
- 生成给人类做决策用的、可以上董事会的 ROI 审计报告
- 跑 A/B 模型实验,附带统计显著性测试
这个服务器就放在你的 Agent 和 LLM 供应商之间,所有调用经过 Cloudflare AI Gateway 进行追踪,每个请求都打上 Agent 的身份标签。成本数据和收入归因数据都通过 MCP 工具暴露出来。
核心思路很简单:成本追踪告诉你花多少钱,收入归因告诉你赚多少钱。放一起就是每个 Agent 的损益表——这样你才能像管理真实团队一样管 AI Agent。市面上大多数“AI 成本工具”只做到成本侧。收入归因这一步,才让这套方案从“账单面板”升级成“绩效记分卡”。
10 个工具领域(全都以 metrx_* 前缀命名):
1. Agent 舰队概览与绩效总览(3 个工具)
2. 优化——模型路由、供应商套利(4 个工具)
3. 预算管理与强制执行(3 个工具)
4. 告警监控与故障预测(3 个工具)
5. A/B 模型实验与统计分析(3 个工具)
6. 成本泄漏检测与浪费扫描(1 个工具)
7. 收入归因与 ROI 计算(3 个工具)
8. 告警阈值配置(1 个工具)
9. 董事会可用的 ROI 审计报告(1 个工具)
10. 升级理由与商业用例(1 个工具)
技术栈:Next.js 14、Supabase(Postgres + RLS)、Cloudflare AI Gateway、Vercel、TypeScript。MCP 服务器已发布到 npm,并上架 Smithery。
30 秒开玩,无需注册:
npx @metrxbot/mcp-server --demo
想用完整记分卡面板 + 收入归因 + 团队功能?👉 https://metrxbot.com
定价:免费版(3 个 Agent)→ Lite 版 $19/月(10 个 Agent)→ Pro 版 $49/月(不限 Agent 数)
标题:Hey HN – Metrx,AI 代理记分卡,帮它们看懂并优化自己的价值
关于反馈,我想听听你们的看法:
- 如果你在生产环境中跑 AI 代理——你们现在能把收入归因到某个具体的代理上吗?还是说只能看整体的花销?
- MCP 这种方案(让代理自己具备性能意识)派得上用场吗?还是说你们更喜欢只有人类能看的仪表盘?
- “代理自动生成自己的 ROI 审计”这个功能——是巧妙,还是太奇怪了?
关于底层架构的任何技术问题,随时欢迎提问。