Epoch AI 的 CursorBench 在规模上对 AI 代码编辑进行基准测试

Dev.to ML 2026-06-28T22:22:33.470789

Epoch AI 发布了 CursorBench,这是一个包含 500 个任务的 AI 代码编辑器基准测试。它揭示了与人类相比 15% 的准确率差距以及 3 倍的延迟差异。

Epoch AI 发布了 CursorBench,一个用于 AI 代码编辑器的基准测试。它评估了 500 多个真实世界的编辑任务,测量准确率和延迟。

关键事实

Epoch AI 发布了 CursorBench,这是一个旨在评估 AI 驱动代码编辑工具(如 Cursor、Claude Code 和 GitHub Copilot)的新基准测试。该基准测试涵盖了从真实世界拉取请求中衍生的 500 多个任务,同时衡量编辑的正确性和执行速度。

CursorBench 填补了 SWE-bench 和 HumanEval 留下的空白,后者测试的是孤立的代码生成,而非迭代式编辑工作流。该基准测试的任务集包括跨 Python、JavaScript、TypeScript 和 Go 的 bug 修复、功能添加和重构。每个任务提供一个代码库快照、一条自然语言指令以及一个真实差异。早期结果显示,顶级模型与人类表现之间存在 15% 的准确率差距,模型间的延迟差异高达 3 倍。该基准测试还衡量编辑精度——模型是否引入了非预期的更改。Epoch AI 计划发布排行榜和一个公开评估工具。

为什么这个基准测试很重要

CursorBench 的出现正值 AI 代码编辑器从自动补全转向智能体多文件编辑之时。估值超过 90 亿美元的 Cursor 最近宣布了一个从零开始为代码生成训练的 GPT 级别模型。Claude Code 和 GitHub Copilot 也瞄准了相同的工作流。CursorBench 为这一新兴类别提供了首个标准化测试,可能成为代码编辑智能体的事实标准。

它是如何运作的

任务来源于带有已验证拉取请求差异的开源仓库。模型接收 PR 之前的仓库状态,并必须输出正确的差异。评估包括精确匹配、编辑距离以及通过测试套件进行的功能正确性。延迟是端到端测量的,包括推理和上下文加载。Epoch AI 的方法论与 SWE-bench 相似,但专注于日常开发中更小、更频繁的编辑——而非整个仓库的补丁。这使得 CursorBench 更能代表实时编码助手的使用场景。

关键要点

Epoch AI 发布了 CursorBench,一个包含 500 个任务的 AI 代码编辑器基准测试。它揭示了与人类相比 15% 的准确率差距以及 3 倍的延迟差异。

值得关注的点

关注预计两周内发布的第一个公开 CursorBench 排行榜,以及 Cursor 的新自定义模型是否能缩小与人类表现之间 15% 的差距。

除了 CursorBench,Epoch AI 还推出了 MirrorCode,一个测试 AI 能否仅凭行为描述重建整个程序的基准测试。MirrorCode 要求模型基于输入输出示例从头重建软件,旨在衡量自主编码的上限。早期结果显示,即使是顶级模型在超过 500 行的项目上也失败了,凸显了端到端软件生成中的显著能力天花板。

查看原文