最佳 AI 编程助手(2026 年 6 月):评分排行榜,Fable 5 发布后更新
2026 年 6 月的最佳 AI 编程助手取决于与你工作匹配的基准测试。搭载 GPT-5.5 的 Codex CLI 在 Terminal-Bench 2.1 上以 83.4% 领先;搭载 Fable 5 的 Claude Code 以 83.1% 紧随其后,搭载 Opus 4.8 的 Claude Code 则为 78.9%。在 SWE-bench Verified 上,Fable 5 以 95.0% 领先,Opus 4.8 为 88.6%。在 SWE-bench Pro 上,Fable 5 以 80.3% 领先,Opus 4.8 为 69.2%。截至 6 月 12 日,Fable 5 和 Mythos 5 已暂停出口。
这是一个评分排行榜,日期为 2026-06-18。编程助手列将每个工具与其运行的模型配对;基准测试列使用已发布的助手加模型成绩(Terminal-Bench 2.1),否则使用底层模型成绩(SWE-bench Verified 和 Pro)。价格为该条目的付费层加上包含用量用完后的每 token 或每积分费率。此处内容均非付费推广。
83.4%
Terminal-Bench 2.1 最高分(Codex CLI + GPT-5.5)
95.0%
SWE-bench Verified 最高分模型(Fable 5,已暂停)
80.3%
SWE-bench Pro 最高分模型(Fable 5,已暂停)
$0.01
GitHub Copilot AI 积分(自 6 月 1 日起按用量计费)
评分排行榜:AI 编程助手(2026 年 6 月)
每行对应一个编程助手与其可用的最强模型配对。SWE-bench Verified 和 SWE-bench Pro 为底层模型成绩;Terminal-Bench 2.1(Terminal-Bench v2)为助手加模型成绩。开源编程助手可运行任意模型,因此其模型行显示它们最常驱动的前沿模型。所有成绩日期为 2026-06-18,来源见下文。
AI 编程助手评分表(2026 年 6 月 18 日)
| 代理/模型 | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.1 | 定价模式 | 更新日期 |
|---|---|---|---|---|---|
| Codex CLI / GPT-5.5 | 88.7% (OpenAI) | 58.6% | 83.4% | 20美元/月 Plus + 积分 | 2026-05-01 |
| Claude Code / Fable 5 | 95.0% | 80.3% | 83.1% | 17美元/月 Pro(已暂停) | 2026-06-17 |
| Claude Code / Opus 4.8 | 88.6% | 69.2% | 78.9% | 17美元/月 Pro(年度) | 2026-05-29 |
| Gemini CLI / Gemini 3.1 Pro | 80.6% | 54.2% | 70.7% | 免费,每天1000次请求 | 2026-05-05 |
| GitHub Copilot / 多模型 | model-set | model-set | 无数据 | 0.01美元/积分,按用量计费 | 2026-06-01 |
| Cursor / Composer + frontier | model-set | model-set | 无数据 | 20美元/月 + 消耗费率 | 2026-06-18 |
| OpenCode / 任意模型 (BYOK) | model-set | model-set | 无数据 | 免费,向模型提供商付费 | 2026-06-18 |
| Cline / 任意模型 (BYOK) | model-set | model-set | 无数据 | 免费,向模型提供商付费 | 2026-06-18 |
| Goose / 任意模型 (BYOK) | model-set | model-set | 无数据 | 免费,自带密钥或订阅 | 2026-06-18 |
| Aider / 任意模型 (BYOK) | model-set | model-set | 无数据 | 免费,向模型提供商付费 | 2026-06-18 |
| Kilo Code / 任意模型 (BYOK) | model-set | model-set | 无数据 | 免费,无加价网关 | 2026-06-18 |
| Kiro / Sonnet 4.5 + 开源 | model-set | model-set | 无数据 | 免费 / 20美元/月,积分 | 2026-06-18 |
| Google Antigravity / Gemini 3.1 Pro | 80.6% | 54.2% | 70.3% (Terminus 2) | 19.99美元/月 AI Pro | 2026-05-19 |
| Morph router / 开源模型 | model-set | model-set | 无数据 | 每百万token 0.139/0.278美元 (dsv4flash) | 2026-06-18 |
最佳AI编程代理(2026年6月):Fable 5更新后的评分排行榜
BYOK(自带密钥):代理免费,你直接向模型提供商付费或运行本地模型。"model-set"表示代理运行你指定的任何模型,因此其基准分数等于你选择的模型行的分数(顶部行)。"No entry"表示该代理在Terminal-Bench 2.1排行榜上没有已发布的条目。GPT-5.5的SWE-bench Verified分数由OpenAI报告(88.7%);它尚未出现在独立的llm-stats排行榜上。Codex + GPT-5.5的Terminal-Bench分数日期为2026-05-01;Fable 5条目日期为2026-06-17。SWE-bench Pro数据由供应商在Anthropic/OpenAI支架上报告(Scale的标准化公开集将GPT-5.4 xHigh排名为59.1%)。Fable 5和Mythos 5已暂停出口。
基准测试详解
三个基准测试将不同代理区分开来。SWE-bench Verified衡量模型是否解决了GitHub上的真实Python问题(人工验证,500个任务)。SWE-bench Pro是更困难、抗污染的测试集,基于更大的商业风格代码库。Terminal-Bench v2(2.1排行榜)衡量代理是否端到端完成终端驱动的任务,对"代理+模型"配对进行评分,而非仅对模型评分。
各基准测试衡量内容
| 基准测试 | 衡量指标 | 评分单元 | 2026年6月领先者 |
|---|---|---|---|
| SWE-bench Verified | GitHub Python错误修复,人工验证 | 模型 | Fable 5 (95.0%) |
| SWE-bench Pro | 更困难、抗污染的问题 | 模型 | Fable 5 (80.3%) |
| Terminal-Bench v2 (2.1) | 端到端终端任务完成 | 代理 + 模型 | Codex + GPT-5.5 (83.4%) |
| ProjDevBench | 端到端项目构建,20个问题 | 代理 + 模型 | Codex + GPT-5 (77.85%) |
ProjDevBench(arXiv 2602.01655,2026年2月)增加了端到端项目开发视角:代理平均每个问题需要138次交互和481万个令牌,Codex on GPT-5以77.85%的整体得分领先,平均接受率为27.38%。它的运行频率低于Terminal-Bench,因此将其数字视为快照。
2026年6月的变化(Fable 5之后)
更新于2026年6月18日。Claude Fable 5条目于6月17日登陆Terminal-Bench 2.1排行榜:Claude Code + Fable 5为83.1%,Terminus 2 + Fable 5为80.4%,均略低于Codex + GPT-5.5的83.4%。Fable 5在SWE-bench Verified上以95.0%领先,在SWE-bench Pro上以80.3%领先,但Fable 5和Mythos 5自6月12日起暂停出口,因此大多数用户目前无法运行它们。
最佳开源AI编程代理(2026)
开源代理可免费安装,并可在你指向的任何模型上运行。按GitHub星标排序,这比营销更能反映实际采用情况:
按GitHub星标排序的开源编程代理(2026年6月)
| 代理 | 星标 | 许可证 | 语言/界面 |
|---|---|---|---|
| OpenCode | 172,198 | MIT | CLI + 桌面,75+提供商 |
| Gemini CLI | 105,104 | Apache-2.0 | CLI,每天1000次免费请求 |
| OpenAI Codex CLI | 89,991 | Apache-2.0 | Rust CLI + IDE + 云端 |
| Cline | 62,996 | Apache-2.0 | VS Code + JetBrains + CLI |
| Goose | 48,542 | Apache-2.0 | Rust 桌面 + CLI |
| Aider | 45,945 | Apache-2.0 | Python CLI,Git原生 |
| Kilo Code | 19,968 | MIT | VS Code + CLI |
anthropics/claude-code 拥有131,380个星标,但该工具是专有的(许可证字段为空,该仓库仅用于问题跟踪和文档),因此不在本开源列表中。OpenCode已迁移至anomalyco/opencode(从sst/opencode重定向)。Goose在Linux基金会Agentic AI Foundation下迁移至aaif-goose/goose。Aider的最后一次仓库推送是2026-05-22,其更新节奏明显慢于每日推送的OpenCode和Cline。
1. OpenAI Codex
83.4%
Terminal-Bench 2.1(GPT-5.5,第1名)
89,991
GitHub星标(Apache-2.0)
20美元/月
ChatGPT Plus入门级
基于GPT-5.5的Codex CLI在Terminal-Bench 2.1上以83.4%的成绩占据榜首(条目日期为2026-05-01)。它涵盖来自单一账户的五种界面:CLI、VS Code的IDE扩展、Cursor、Windsurf、Codex Web云端代理(chatgpt.com/codex)、桌面应用(codex app)以及iOS。云端集成包括自动代码审查和Slack。
使用 curl -fsSL https://chatgpt.com/codex/install.sh | sh、npm install -g @openai/codex 或 brew install --cask codex 安装CLI,然后运行 codex 并使用ChatGPT登录。在对话中使用 /model 切换模型(GPT-5.4、GPT-5.3-Codex 等,支持可调节推理层级)。您也可以使用OpenAI API密钥进行身份验证,并按token支付API费率,不过使用API密钥模式会关闭云端功能。
最适合: 追求最高Terminal-Bench(终端基准测试)分数以及“一劳永逸”云端任务的开发者。Plus和Pro套餐共享一个5小时的本地与云端使用总时长窗口。查看 Codex与Claude Code对比。
2. Claude Code (Anthropic)
83.1%
Terminal-Bench 2.1(Fable 5,已暂停出口)
88.6%
SWE-bench Verified(Opus 4.8,可用)
$17/月
Pro套餐(年付),包含Claude Code
Claude Code在您的Shell中运行,并通过VS Code或JetBrains连接至任何编辑器,同时提供macOS和Windows桌面应用。在Terminal-Bench 2.1上,使用Fable 5(条目2026-06-17)得分为83.1%,使用Opus 4.8得分为78.9%(±2.5)。Fable 5在SWE-bench Verified上以95.0%领先,在SWE-bench Pro上以80.3%领先,但自6月12日起已暂停出口,因此大多数用户运行Opus 4.8,其在SWE-bench Verified上得分为88.6%,在SWE-bench Pro上得分为69.2%。Anthropic表示,Opus 4.8让其自身代码中的缺陷未被发现的可能性比前代模型低大约四倍。
原生安装(推荐):在macOS、Linux或WSL上运行 curl -fsSL https://claude.ai/install.sh | bash;在Windows PowerShell上运行 irm https://claude.ai/install.ps1 | iex。此外还可使用 brew install --cask claude-code、winget install Anthropic.ClaudeCode、npm install -g @anthropic-ai/claude-code(需Node 18+)以及已签名的apt/dnf/apk仓库。通过 claude mcp add --transport http notion https://mcp.notion.com/mcp 添加MCP服务器。
最适合: 希望获得SWE-bench上最强大底层模型,以及既能在终端又能在IDE中运行工具的开发者。系统要求:macOS 13.0+、Windows 10 1809+、Ubuntu 20.04+、4GB+ RAM。与 Cursor 对比。
3. Gemini CLI
70.7%
Terminal-Bench 2.1(Gemini 3.1 Pro)
105,104
GitHub 星标 (Apache-2.0 许可证)
1,000/天
个人账户的免费请求次数
Gemini CLI 是本榜单中最慷慨的免费方案:通过 OAuth 使用个人 Google 账户,每分钟 60 次请求,每天 1,000 次请求,由托管的 Gemini 3 混合模型(flash 和 pro)提供服务。在 Terminal-Bench 2.1 上,Gemini CLI 搭配 Gemini 3.1 Pro 得分 70.7%(±2.9)。
使用 npx @google/gemini-cli、npm install -g @google/gemini-cli 或 brew install gemini-cli 安装。MCP 服务器在 ~/.gemini/settings.json 中配置。使用 API 密钥可以固定特定模型(例如 gemini-2.5-flash),而不是 OAuth 管理的混合模型。
最佳适用人群: 希望以零成本获得强大 Agent 且每日配额充足的开发者。可与 Codex 和 Claude Code 对比。
4. GitHub Copilot
$0.01
每 AI 积分(自 6 月 1 日起按用量计费)
免费层
每月 2,000 次补全,不计入积分
$10/月
Pro:1,500 积分(价值 $15)
自 2026 年 6 月 1 日起,Copilot 改用基于用量的计费方式,使用 GitHub AI 积分。1 积分等于 $0.01。高级请求单位已取消;积分根据公布的各模型费率按 token 用量(输入、缓存、输出)消耗。基本的代码补全和下一编辑建议不计入积分,付费计划中保持无限制。
使用 npm install -g @github/copilot(Node 22+)、brew install copilot-cli 或 winget install GitHub.Copilot 安装 CLI。它支持 MCP 服务器和 /model 斜杠命令。模型菜单涵盖 Claude Opus 4.5 至 4.8(每百万 token 输入 $5 / 输出 $25)、Sonnet 4 至 4.6($3 / $15)、GPT-5.5(上下文 272K 或以下时 $5 / $30)、GPT-5.4($2.50 / $15)、Gemini 3.1 Pro($2 / $12)以及 Claude Fable 5(当前暂停,参见注释)($10 / $50)。
最适合: GitHub 上的团队,希望在 VS Code、JetBrains、Neovim 和 Xcode 上通过统一账单获得补全、聊天、代理模式、云端代理和代码审查。截至 2026 年 6 月,付费 Copilot 计划的新注册在计费推出期间暂停,将在未来几周重新开放。基于旧版按请求计费的年度订阅用户保留每月 300(Pro)或 1,500(Pro+)个高级请求,每个 0.04 美元。
5. Cursor
20 美元/月
Pro(包含约 20 美元的 API 速率使用量)
Composer 2.5
自研代理模型,独立池
0 美元
Hobby 层级,无需银行卡
Cursor 是一个围绕 AI 重构的 VS Code 分支:Tab 预测多行编辑,Composer 处理多文件修改,代码库索引提供项目上下文。付费计划包括前沿模型、MCP、技能和钩子、云端代理,以及按使用量计费的 Bugbot。
定价模式为包含使用量加消耗速率。Pro 每月 20 美元包含约 20 美元的 API 速率使用量;Pro+ 每月 60 美元包含 70 美元;Ultra 每月 200 美元包含 400 美元。选择 Auto 或 Cursor 自研的 Composer 2.5 模型会从一个独立、更慷慨的池中抽取,该池专为日常代理编码设计,成本低于前沿 API 模型。模型选择决定消耗速率。
最适合: 希望不离开编辑器就能获得内联 AI 编辑的开发者。参见 Cursor 替代品 了解免费选项。
6. OpenCode
172,198
GitHub 星标(最受关注的 OSS 代理)
75+
通过 AI SDK 支持的 LLM 提供商
MIT
许可证,免费运行
OpenCode(anomalyco/opencode,从 sst/opencode 重定向)是目前星标最多的开源编码代理,拥有 172,198 个星标,领先于 Gemini CLI 和 Codex。它通过 AI SDK 和 Models.dev 目录支持 75 多个 LLM 提供商,还能通过 Ollama、LM Studio 和 llama.cpp 使用本地模型。OpenCode Zen 是团队精选的、经测试适用于代理编码的模型列表。
使用 curl -fsSL https://opencode.ai/install | bash、npm install -g opencode-ai 或 brew install anomalyco/tap/opencode 安装。通过 JSON 添加自定义的 OpenAI 兼容提供商:
{
"provider": {
"myprovider": {
"npm": "@ai-sdk/openai-compatible",
"options": { "baseURL": "https://api.myprovider.com/v1" },
"models": { }
}
}
}
最佳适用人群: 希望获得 Claude Code 风格 CLI,但又不想被单一模型供应商锁定的开发者。与 Claude Code 和 Codex 对比。
7. Cline
62,996
GitHub 星标(Apache-2.0 许可)
任意模型
Claude、GPT、Gemini、BYOK 或本地模型
免费
仅按模型用量付费
Cline 是一个基于 Apache-2.0 许可的代理,运行在 VS Code、JetBrains(早期访问版)、Cursor 和 Windsurf 中,同时提供了通过 npm i -g cline 安装的 CLI,支持 macOS、Windows 和 Linux。其主页宣传语是“所有模型,任你选择”:Claude、GPT、Gemini、任意兼容 OpenAI 的端点、BYOK,或者通过 Ollama 和 LM Studio 使用本地模型。它支持 MCP 服务器和自定义工具,并提供企业版(cline.bot/enterprise)。
对于本地运行,Cline 的文档建议:小规模或量化模型需要 16-32GB RAM,中等规模的编码模型需要 32-64GB,更大模型则需要 64GB 以上,并建议启用“使用紧凑提示”(Use Compact Prompt)设置。
最佳适用人群: 想要代理式 AI 但不想订阅付费的 VS Code 或 JetBrains 用户。与 Claude Code 和 Cursor 对比。
8. Goose(Linux Foundation AAIF)
48,542
GitHub 星标(Apache-2.0 许可,Rust 语言)
15+
提供商,70+ MCP 扩展
免费
开源,BYOK 或订阅模式
Goose 已从 block/goose 迁移至 Linux 基金会的 Agentic AI Foundation(aaif-goose/goose)。它使用 Rust 构建,以桌面应用形式发布,支持 macOS、Linux 和 Windows,同时还提供 CLI 和 API。它支持 15+ 个提供商(Anthropic、OpenAI、Google、Ollama、OpenRouter、Azure、Bedrock 等),可以通过 ACP 重用现有的 Claude、ChatGPT 或 Gemini 订阅,并通过 MCP 连接 70+ 个扩展。
9. Aider
45,945
GitHub stars (Apache-2.0)
Git原生
每次变更自动提交
2026-05-22
最近一次仓库推送(更新较慢)
Aider 是一款 Git 原生终端代理:每次变更都会附带描述性提交记录进行暂存,无需复制粘贴或手动暂存。安装方式:python -m pip install aider-install && aider-install;单行命令 curl -LsSf https://aider.chat/install.sh | sh;或使用 uv、pipx、pip 安装。运行时通过标志连接模型,例如 aider --model sonnet --api-key anthropic=<key> 或 aider --model deepseek --api-key deepseek=<key>,并通过 Ollama 和任何兼容 OpenAI 的 API 运行本地模型。
需要注意:Aider 最近一次仓库推送是 2026-05-22,比每日推送的 OpenCode 和 Cline 更新更慢;其模型推荐仍然建议使用 Gemini 2.5 Pro、DeepSeek R1/V3、Claude 3.7 Sonnet、o3/o4-mini 和 GPT-4.1,而非 2026 年前沿模型。不过你仍可以通过标志将其指向任何当前模型。
最佳适用场景: 希望获得 Git 集成编辑功能并完全控制付费模型的终端原生开发者。与 Claude Code 和 Cline 进行对比。
10. Kilo Code
19,968
GitHub stars (MIT)
无加成
Kilo Gateway 按实际提供商费率收费
$0
扩展免费且开源
Kilo Code (Kilo-Org/kilocode) 是一款免费开源扩展。Kilo Gateway 每月 $0,按精确提供商费率收费,无任何加价。Kilo Pass 订阅分为 $19、$49 和 $199/月三档,最高可获 50% 奖励积分;Teams 版为 $15/用户/月。BYOK 支持 Anthropic、OpenAI、Google、Azure 和 Bedrock 密钥,无需 Kilo 订阅计划。kilocode.ai 域名现 308 跳转到 kilo.ai。
最适合: 希望使用无加价网关定价或自带密钥(BYOK)并可选奖励积分通行证的开发者。对比 Claude Code。
11. Kiro
$0
免费层:每月 50 积分
$20/月
Pro:1000 积分
$0.04
超额积分,月底计费
Kiro 是一款基于积分的 IDE。免费层每月提供 50 积分,可使用开放权重模型和 Claude Sonnet 4.5。Pro 版 $20/月获 1000 积分,Pro+ 版 $40/月获 2000 积分,Power 版 $200/月获 10000 积分。超额积分 $0.04/积分,月底计费,未用完的积分不累积。团队计划与个人积分相同,另增加集中计费、使用分析和通过 AWS IAM Identity Center 的 SSO。AWS GovCloud 定价约高出 20%,且无免费层。新用户首次升级可获 $20 积分抵扣。
最适合: 希望拥有可预测积分预算且免费层包含 Claude Sonnet 4.5 的开发者。对比 Cursor。