headroom

headroom 是一个专为大语言模型(LLM)场景设计的压缩工具,能在工具输出、日志、文件及 RAG 块到达 LLM 之前进行高效压缩,减少 60% 至 95% 的 token 消耗,同时保持答案质量不变。它支持多种集成方式:可作为 Python 库或 TypeScript 库直接调用,提供 API 代理(proxy)实现透明压缩,还实现了 MCP Server(Model Context Protocol 服务端)以便与 Claude Code、Cursor 等 AI 代理无缝对接。headroom 适用于 agent、prompt engineering、context window 优化、RAG 管道等场景,兼容 OpenAI、Anthropic、LangChain、FastAPI 等主流框架。其核心亮点在于不修改 LLM 调用逻辑的前提下大幅降低 token 成本,尤其适合高频调用、长上下文或需要压缩多轮对话的场景,是解决 LLM 上下文窗口溢出与成本控制的实用基础设施。

在 GitHub 查看