最佳 AI 编程助手(2026 年 6 月):评分排行榜,Fable 5 发布后更新

www.morphllm.com 2026-07-10T15:16:03.632707

2026 年 6 月的最佳 AI 编程助手取决于与你工作匹配的基准测试。搭载 GPT-5.5 的 Codex CLI 在 Terminal-Bench 2.1 上以 83.4% 领先;搭载 Fable 5 的 Claude Code 以 83.1% 紧随其后,搭载 Opus 4.8 的 Claude Code 则为 78.9%。在 SWE-bench Verified 上,Fable 5 以 95.0% 领先,Opus 4.8 为 88.6%。在 SWE-bench Pro 上,Fable 5 以 80.3% 领先,Opus 4.8 为 69.2%。截至 6 月 12 日,Fable 5 和 Mythos 5 已暂停出口。

这是一个评分排行榜,日期为 2026-06-18。编程助手列将每个工具与其运行的模型配对;基准测试列使用已发布的助手加模型成绩(Terminal-Bench 2.1),否则使用底层模型成绩(SWE-bench Verified 和 Pro)。价格为该条目的付费层加上包含用量用完后的每 token 或每积分费率。此处内容均非付费推广。

83.4%
Terminal-Bench 2.1 最高分(Codex CLI + GPT-5.5)

95.0%
SWE-bench Verified 最高分模型(Fable 5,已暂停)

80.3%
SWE-bench Pro 最高分模型(Fable 5,已暂停)

$0.01
GitHub Copilot AI 积分(自 6 月 1 日起按用量计费)

评分排行榜:AI 编程助手(2026 年 6 月)

每行对应一个编程助手与其可用的最强模型配对。SWE-bench Verified 和 SWE-bench Pro 为底层模型成绩;Terminal-Bench 2.1(Terminal-Bench v2)为助手加模型成绩。开源编程助手可运行任意模型,因此其模型行显示它们最常驱动的前沿模型。所有成绩日期为 2026-06-18,来源见下文。

AI 编程助手评分表(2026 年 6 月 18 日)

代理/模型 SWE-bench Verified SWE-bench Pro Terminal-Bench 2.1 定价模式 更新日期
Codex CLI / GPT-5.5 88.7% (OpenAI) 58.6% 83.4% 20美元/月 Plus + 积分 2026-05-01
Claude Code / Fable 5 95.0% 80.3% 83.1% 17美元/月 Pro(已暂停) 2026-06-17
Claude Code / Opus 4.8 88.6% 69.2% 78.9% 17美元/月 Pro(年度) 2026-05-29
Gemini CLI / Gemini 3.1 Pro 80.6% 54.2% 70.7% 免费,每天1000次请求 2026-05-05
GitHub Copilot / 多模型 model-set model-set 无数据 0.01美元/积分,按用量计费 2026-06-01
Cursor / Composer + frontier model-set model-set 无数据 20美元/月 + 消耗费率 2026-06-18
OpenCode / 任意模型 (BYOK) model-set model-set 无数据 免费,向模型提供商付费 2026-06-18
Cline / 任意模型 (BYOK) model-set model-set 无数据 免费,向模型提供商付费 2026-06-18
Goose / 任意模型 (BYOK) model-set model-set 无数据 免费,自带密钥或订阅 2026-06-18
Aider / 任意模型 (BYOK) model-set model-set 无数据 免费,向模型提供商付费 2026-06-18
Kilo Code / 任意模型 (BYOK) model-set model-set 无数据 免费,无加价网关 2026-06-18
Kiro / Sonnet 4.5 + 开源 model-set model-set 无数据 免费 / 20美元/月,积分 2026-06-18
Google Antigravity / Gemini 3.1 Pro 80.6% 54.2% 70.3% (Terminus 2) 19.99美元/月 AI Pro 2026-05-19
Morph router / 开源模型 model-set model-set 无数据 每百万token 0.139/0.278美元 (dsv4flash) 2026-06-18

最佳AI编程代理(2026年6月):Fable 5更新后的评分排行榜

BYOK(自带密钥):代理免费,你直接向模型提供商付费或运行本地模型。"model-set"表示代理运行你指定的任何模型,因此其基准分数等于你选择的模型行的分数(顶部行)。"No entry"表示该代理在Terminal-Bench 2.1排行榜上没有已发布的条目。GPT-5.5的SWE-bench Verified分数由OpenAI报告(88.7%);它尚未出现在独立的llm-stats排行榜上。Codex + GPT-5.5的Terminal-Bench分数日期为2026-05-01;Fable 5条目日期为2026-06-17。SWE-bench Pro数据由供应商在Anthropic/OpenAI支架上报告(Scale的标准化公开集将GPT-5.4 xHigh排名为59.1%)。Fable 5和Mythos 5已暂停出口。

基准测试详解

三个基准测试将不同代理区分开来。SWE-bench Verified衡量模型是否解决了GitHub上的真实Python问题(人工验证,500个任务)。SWE-bench Pro是更困难、抗污染的测试集,基于更大的商业风格代码库。Terminal-Bench v2(2.1排行榜)衡量代理是否端到端完成终端驱动的任务,对"代理+模型"配对进行评分,而非仅对模型评分。

各基准测试衡量内容

基准测试 衡量指标 评分单元 2026年6月领先者
SWE-bench Verified GitHub Python错误修复,人工验证 模型 Fable 5 (95.0%)
SWE-bench Pro 更困难、抗污染的问题 模型 Fable 5 (80.3%)
Terminal-Bench v2 (2.1) 端到端终端任务完成 代理 + 模型 Codex + GPT-5.5 (83.4%)
ProjDevBench 端到端项目构建,20个问题 代理 + 模型 Codex + GPT-5 (77.85%)

ProjDevBench(arXiv 2602.01655,2026年2月)增加了端到端项目开发视角:代理平均每个问题需要138次交互和481万个令牌,Codex on GPT-5以77.85%的整体得分领先,平均接受率为27.38%。它的运行频率低于Terminal-Bench,因此将其数字视为快照。

2026年6月的变化(Fable 5之后)

更新于2026年6月18日。Claude Fable 5条目于6月17日登陆Terminal-Bench 2.1排行榜:Claude Code + Fable 5为83.1%,Terminus 2 + Fable 5为80.4%,均略低于Codex + GPT-5.5的83.4%。Fable 5在SWE-bench Verified上以95.0%领先,在SWE-bench Pro上以80.3%领先,但Fable 5和Mythos 5自6月12日起暂停出口,因此大多数用户目前无法运行它们。

最佳开源AI编程代理(2026)

开源代理可免费安装,并可在你指向的任何模型上运行。按GitHub星标排序,这比营销更能反映实际采用情况:

按GitHub星标排序的开源编程代理(2026年6月)

代理 星标 许可证 语言/界面
OpenCode 172,198 MIT CLI + 桌面,75+提供商
Gemini CLI 105,104 Apache-2.0 CLI,每天1000次免费请求
OpenAI Codex CLI 89,991 Apache-2.0 Rust CLI + IDE + 云端
Cline 62,996 Apache-2.0 VS Code + JetBrains + CLI
Goose 48,542 Apache-2.0 Rust 桌面 + CLI
Aider 45,945 Apache-2.0 Python CLI,Git原生
Kilo Code 19,968 MIT VS Code + CLI

anthropics/claude-code 拥有131,380个星标,但该工具是专有的(许可证字段为空,该仓库仅用于问题跟踪和文档),因此不在本开源列表中。OpenCode已迁移至anomalyco/opencode(从sst/opencode重定向)。Goose在Linux基金会Agentic AI Foundation下迁移至aaif-goose/goose。Aider的最后一次仓库推送是2026-05-22,其更新节奏明显慢于每日推送的OpenCode和Cline。

1. OpenAI Codex

83.4%
Terminal-Bench 2.1(GPT-5.5,第1名)

89,991
GitHub星标(Apache-2.0)

20美元/月
ChatGPT Plus入门级

基于GPT-5.5的Codex CLI在Terminal-Bench 2.1上以83.4%的成绩占据榜首(条目日期为2026-05-01)。它涵盖来自单一账户的五种界面:CLI、VS Code的IDE扩展、Cursor、Windsurf、Codex Web云端代理(chatgpt.com/codex)、桌面应用(codex app)以及iOS。云端集成包括自动代码审查和Slack。

使用 curl -fsSL https://chatgpt.com/codex/install.sh | shnpm install -g @openai/codexbrew install --cask codex 安装CLI,然后运行 codex 并使用ChatGPT登录。在对话中使用 /model 切换模型(GPT-5.4、GPT-5.3-Codex 等,支持可调节推理层级)。您也可以使用OpenAI API密钥进行身份验证,并按token支付API费率,不过使用API密钥模式会关闭云端功能。

最适合: 追求最高Terminal-Bench(终端基准测试)分数以及“一劳永逸”云端任务的开发者。Plus和Pro套餐共享一个5小时的本地与云端使用总时长窗口。查看 Codex与Claude Code对比

2. Claude Code (Anthropic)

83.1%
Terminal-Bench 2.1(Fable 5,已暂停出口)

88.6%
SWE-bench Verified(Opus 4.8,可用)

$17/月
Pro套餐(年付),包含Claude Code

Claude Code在您的Shell中运行,并通过VS Code或JetBrains连接至任何编辑器,同时提供macOS和Windows桌面应用。在Terminal-Bench 2.1上,使用Fable 5(条目2026-06-17)得分为83.1%,使用Opus 4.8得分为78.9%(±2.5)。Fable 5在SWE-bench Verified上以95.0%领先,在SWE-bench Pro上以80.3%领先,但自6月12日起已暂停出口,因此大多数用户运行Opus 4.8,其在SWE-bench Verified上得分为88.6%,在SWE-bench Pro上得分为69.2%。Anthropic表示,Opus 4.8让其自身代码中的缺陷未被发现的可能性比前代模型低大约四倍。

原生安装(推荐):在macOS、Linux或WSL上运行 curl -fsSL https://claude.ai/install.sh | bash;在Windows PowerShell上运行 irm https://claude.ai/install.ps1 | iex。此外还可使用 brew install --cask claude-codewinget install Anthropic.ClaudeCodenpm install -g @anthropic-ai/claude-code(需Node 18+)以及已签名的apt/dnf/apk仓库。通过 claude mcp add --transport http notion https://mcp.notion.com/mcp 添加MCP服务器。

最适合: 希望获得SWE-bench上最强大底层模型,以及既能在终端又能在IDE中运行工具的开发者。系统要求:macOS 13.0+、Windows 10 1809+、Ubuntu 20.04+、4GB+ RAM。与 Cursor 对比。

3. Gemini CLI

70.7%
Terminal-Bench 2.1(Gemini 3.1 Pro)

105,104
GitHub 星标 (Apache-2.0 许可证)

1,000/天
个人账户的免费请求次数

Gemini CLI 是本榜单中最慷慨的免费方案:通过 OAuth 使用个人 Google 账户,每分钟 60 次请求,每天 1,000 次请求,由托管的 Gemini 3 混合模型(flash 和 pro)提供服务。在 Terminal-Bench 2.1 上,Gemini CLI 搭配 Gemini 3.1 Pro 得分 70.7%(±2.9)。

使用 npx @google/gemini-clinpm install -g @google/gemini-clibrew install gemini-cli 安装。MCP 服务器在 ~/.gemini/settings.json 中配置。使用 API 密钥可以固定特定模型(例如 gemini-2.5-flash),而不是 OAuth 管理的混合模型。

最佳适用人群: 希望以零成本获得强大 Agent 且每日配额充足的开发者。可与 CodexClaude Code 对比。

4. GitHub Copilot

$0.01
每 AI 积分(自 6 月 1 日起按用量计费)

免费层
每月 2,000 次补全,不计入积分

$10/月
Pro:1,500 积分(价值 $15)

自 2026 年 6 月 1 日起,Copilot 改用基于用量的计费方式,使用 GitHub AI 积分。1 积分等于 $0.01。高级请求单位已取消;积分根据公布的各模型费率按 token 用量(输入、缓存、输出)消耗。基本的代码补全和下一编辑建议不计入积分,付费计划中保持无限制。

使用 npm install -g @github/copilot(Node 22+)、brew install copilot-cliwinget install GitHub.Copilot 安装 CLI。它支持 MCP 服务器和 /model 斜杠命令。模型菜单涵盖 Claude Opus 4.5 至 4.8(每百万 token 输入 $5 / 输出 $25)、Sonnet 4 至 4.6($3 / $15)、GPT-5.5(上下文 272K 或以下时 $5 / $30)、GPT-5.4($2.50 / $15)、Gemini 3.1 Pro($2 / $12)以及 Claude Fable 5(当前暂停,参见注释)($10 / $50)。

最适合: GitHub 上的团队,希望在 VS Code、JetBrains、Neovim 和 Xcode 上通过统一账单获得补全、聊天、代理模式、云端代理和代码审查。截至 2026 年 6 月,付费 Copilot 计划的新注册在计费推出期间暂停,将在未来几周重新开放。基于旧版按请求计费的年度订阅用户保留每月 300(Pro)或 1,500(Pro+)个高级请求,每个 0.04 美元。

5. Cursor

20 美元/月
Pro(包含约 20 美元的 API 速率使用量)

Composer 2.5
自研代理模型,独立池

0 美元
Hobby 层级,无需银行卡

Cursor 是一个围绕 AI 重构的 VS Code 分支:Tab 预测多行编辑,Composer 处理多文件修改,代码库索引提供项目上下文。付费计划包括前沿模型、MCP、技能和钩子、云端代理,以及按使用量计费的 Bugbot。

定价模式为包含使用量加消耗速率。Pro 每月 20 美元包含约 20 美元的 API 速率使用量;Pro+ 每月 60 美元包含 70 美元;Ultra 每月 200 美元包含 400 美元。选择 Auto 或 Cursor 自研的 Composer 2.5 模型会从一个独立、更慷慨的池中抽取,该池专为日常代理编码设计,成本低于前沿 API 模型。模型选择决定消耗速率。

最适合: 希望不离开编辑器就能获得内联 AI 编辑的开发者。参见 Cursor 替代品 了解免费选项。

6. OpenCode

172,198
GitHub 星标(最受关注的 OSS 代理)

75+
通过 AI SDK 支持的 LLM 提供商

MIT
许可证,免费运行

OpenCode(anomalyco/opencode,从 sst/opencode 重定向)是目前星标最多的开源编码代理,拥有 172,198 个星标,领先于 Gemini CLI 和 Codex。它通过 AI SDK 和 Models.dev 目录支持 75 多个 LLM 提供商,还能通过 Ollama、LM Studio 和 llama.cpp 使用本地模型。OpenCode Zen 是团队精选的、经测试适用于代理编码的模型列表。

使用 curl -fsSL https://opencode.ai/install | bashnpm install -g opencode-aibrew install anomalyco/tap/opencode 安装。通过 JSON 添加自定义的 OpenAI 兼容提供商:

{
  "provider": {
    "myprovider": {
      "npm": "@ai-sdk/openai-compatible",
      "options": { "baseURL": "https://api.myprovider.com/v1" },
      "models": { }
    }
  }
}

最佳适用人群: 希望获得 Claude Code 风格 CLI,但又不想被单一模型供应商锁定的开发者。与 Claude CodeCodex 对比。

7. Cline

62,996
GitHub 星标(Apache-2.0 许可)

任意模型
Claude、GPT、Gemini、BYOK 或本地模型

免费
仅按模型用量付费

Cline 是一个基于 Apache-2.0 许可的代理,运行在 VS Code、JetBrains(早期访问版)、Cursor 和 Windsurf 中,同时提供了通过 npm i -g cline 安装的 CLI,支持 macOS、Windows 和 Linux。其主页宣传语是“所有模型,任你选择”:Claude、GPT、Gemini、任意兼容 OpenAI 的端点、BYOK,或者通过 Ollama 和 LM Studio 使用本地模型。它支持 MCP 服务器和自定义工具,并提供企业版(cline.bot/enterprise)。

对于本地运行,Cline 的文档建议:小规模或量化模型需要 16-32GB RAM,中等规模的编码模型需要 32-64GB,更大模型则需要 64GB 以上,并建议启用“使用紧凑提示”(Use Compact Prompt)设置。

最佳适用人群: 想要代理式 AI 但不想订阅付费的 VS Code 或 JetBrains 用户。与 Claude CodeCursor 对比。

8. Goose(Linux Foundation AAIF)

48,542
GitHub 星标(Apache-2.0 许可,Rust 语言)

15+
提供商,70+ MCP 扩展

免费
开源,BYOK 或订阅模式

Goose 已从 block/goose 迁移至 Linux 基金会的 Agentic AI Foundation(aaif-goose/goose)。它使用 Rust 构建,以桌面应用形式发布,支持 macOS、Linux 和 Windows,同时还提供 CLI 和 API。它支持 15+ 个提供商(Anthropic、OpenAI、Google、Ollama、OpenRouter、Azure、Bedrock 等),可以通过 ACP 重用现有的 Claude、ChatGPT 或 Gemini 订阅,并通过 MCP 连接 70+ 个扩展。

9. Aider

45,945
GitHub stars (Apache-2.0)

Git原生
每次变更自动提交

2026-05-22
最近一次仓库推送(更新较慢)

Aider 是一款 Git 原生终端代理:每次变更都会附带描述性提交记录进行暂存,无需复制粘贴或手动暂存。安装方式:python -m pip install aider-install && aider-install;单行命令 curl -LsSf https://aider.chat/install.sh | sh;或使用 uv、pipx、pip 安装。运行时通过标志连接模型,例如 aider --model sonnet --api-key anthropic=<key>aider --model deepseek --api-key deepseek=<key>,并通过 Ollama 和任何兼容 OpenAI 的 API 运行本地模型。

需要注意:Aider 最近一次仓库推送是 2026-05-22,比每日推送的 OpenCode 和 Cline 更新更慢;其模型推荐仍然建议使用 Gemini 2.5 Pro、DeepSeek R1/V3、Claude 3.7 Sonnet、o3/o4-mini 和 GPT-4.1,而非 2026 年前沿模型。不过你仍可以通过标志将其指向任何当前模型。

最佳适用场景: 希望获得 Git 集成编辑功能并完全控制付费模型的终端原生开发者。与 Claude CodeCline 进行对比。

10. Kilo Code

19,968
GitHub stars (MIT)

无加成
Kilo Gateway 按实际提供商费率收费

$0
扩展免费且开源

Kilo Code (Kilo-Org/kilocode) 是一款免费开源扩展。Kilo Gateway 每月 $0,按精确提供商费率收费,无任何加价。Kilo Pass 订阅分为 $19、$49 和 $199/月三档,最高可获 50% 奖励积分;Teams 版为 $15/用户/月。BYOK 支持 Anthropic、OpenAI、Google、Azure 和 Bedrock 密钥,无需 Kilo 订阅计划。kilocode.ai 域名现 308 跳转到 kilo.ai。

最适合: 希望使用无加价网关定价或自带密钥(BYOK)并可选奖励积分通行证的开发者。对比 Claude Code

11. Kiro

$0
免费层:每月 50 积分

$20/月
Pro:1000 积分

$0.04
超额积分,月底计费

Kiro 是一款基于积分的 IDE。免费层每月提供 50 积分,可使用开放权重模型和 Claude Sonnet 4.5。Pro 版 $20/月获 1000 积分,Pro+ 版 $40/月获 2000 积分,Power 版 $200/月获 10000 积分。超额积分 $0.04/积分,月底计费,未用完的积分不累积。团队计划与个人积分相同,另增加集中计费、使用分析和通过 AWS IAM Identity Center 的 SSO。AWS GovCloud 定价约高出 20%,且无免费层。新用户首次升级可获 $20 积分抵扣。

最适合: 希望拥有可预测积分预算且免费层包含 Claude Sonnet 4.5 的开发者。对比 Cursor

12. Google Antigravity

查看原文