然而,仅靠固定检查器的静态分析并不够。纯 LLM 评审有几个局限:多次运行结果不稳定、安全问题召回率低、大规模使用成本高,而且容易被无关因素“带偏”。

news.ycombinator.com 2026-08-11T07:05:48.011413

过去 6 年,我们一直在构建一个确定性、纯静态分析的代码评审产品。今年早些时候,我们开始从底层重新思考这个问题,意识到静态分析恰好能弥补纯 LLM 评审的关键盲区。过去 6 个月里,我们构建了一个新的“混合”智能体循环:将静态分析与前沿 AI 智能体结合,在发现和修复代码质量与安全问题上,优于纯静态分析和纯 LLM 工具。今天,我们将其公开发布。

混合架构的工作原理如下:

静态分析解决了 LLM 的几个关键问题:多次运行间的非确定性、安全问题的低召回率(LLM 容易被代码风格分心),以及成本(静态分析缩小范围可减少提示词长度和工具调用)。

在 OpenSSF CVE Benchmark [1](200 多个真实 JS/TS 漏洞)上,我们取得了 81.2% 的准确率和 80.0% 的 F1;对比 Cursor Bugbot(准确率 74.5%,F1 77.42%)、Claude Code(准确率 71.5%,F1 62.99%)、CodeRabbit(准确率 59.4%,F1 36.19%)和 Semgrep CE(准确率 56.9%,F1 38.26%)。

在敏感信息检测上,F1 达到 92.8%;对比 Gitleaks(75.6%)、detect-secrets(64.1%)和 TruffleHog(41.2%)。我们使用了自己开源的分类模型。[2]

完整方法论以及每个工具的评估方式:https://autofix.bot/benchmarks

你可以通过我们的 TUI(终端界面)在任何仓库上交互式地使用 Autofix Bot,也可以把它作为 Claude Code 的插件,或者通过我们的 MCP(模型上下文协议)在任何兼容的 AI 客户端(如 OpenAI Codex)中使用。[3] 我们专为 AI 编码智能体优先的工作流而打造,因此你可以让智能体在每个检查点上自动运行 Autofix Bot。

欢迎今天就试试:https://autofix.bot,我们很期待听到你的反馈!

查看原文