然而,仅靠固定检查器的静态分析并不够。纯 LLM 评审有几个局限:多次运行结果不稳定、安全问题召回率低、大规模使用成本高,而且容易被无关因素“带偏”。
过去 6 年,我们一直在构建一个确定性、纯静态分析的代码评审产品。今年早些时候,我们开始从底层重新思考这个问题,意识到静态分析恰好能弥补纯 LLM 评审的关键盲区。过去 6 个月里,我们构建了一个新的“混合”智能体循环:将静态分析与前沿 AI 智能体结合,在发现和修复代码质量与安全问题上,优于纯静态分析和纯 LLM 工具。今天,我们将其公开发布。
混合架构的工作原理如下:
-
静态扫描:5000+ 个确定性检查器(覆盖代码质量、安全、性能)建立高精度基线。子代理会抑制特定上下文中的误报。
-
AI 评审:智能体以静态分析结果作为锚点进行代码评审。它能使用 AST、数据流图、控制流、导入图等工具,而不仅仅是 grep 和常规 shell 命令。
-
修复:子代理生成修复代码。静态校验框架会在输出干净的 git 补丁之前验证所有修改。
静态分析解决了 LLM 的几个关键问题:多次运行间的非确定性、安全问题的低召回率(LLM 容易被代码风格分心),以及成本(静态分析缩小范围可减少提示词长度和工具调用)。
在 OpenSSF CVE Benchmark [1](200 多个真实 JS/TS 漏洞)上,我们取得了 81.2% 的准确率和 80.0% 的 F1;对比 Cursor Bugbot(准确率 74.5%,F1 77.42%)、Claude Code(准确率 71.5%,F1 62.99%)、CodeRabbit(准确率 59.4%,F1 36.19%)和 Semgrep CE(准确率 56.9%,F1 38.26%)。
在敏感信息检测上,F1 达到 92.8%;对比 Gitleaks(75.6%)、detect-secrets(64.1%)和 TruffleHog(41.2%)。我们使用了自己开源的分类模型。[2]
完整方法论以及每个工具的评估方式:https://autofix.bot/benchmarks
你可以通过我们的 TUI(终端界面)在任何仓库上交互式地使用 Autofix Bot,也可以把它作为 Claude Code 的插件,或者通过我们的 MCP(模型上下文协议)在任何兼容的 AI 客户端(如 OpenAI Codex)中使用。[3] 我们专为 AI 编码智能体优先的工作流而打造,因此你可以让智能体在每个检查点上自动运行 Autofix Bot。
欢迎今天就试试:https://autofix.bot,我们很期待听到你的反馈!