Epoch AI 的 CursorBench 在规模上对 AI 代码编辑进行基准测试
Epoch AI 发布了 CursorBench,这是一个包含 500 个任务的 AI 代码编辑器基准测试。它揭示了与人类相比 15% 的准确率差距以及 3 倍的延迟差异。
Epoch AI 发布了 CursorBench,一个用于 AI 代码编辑器的基准测试。它评估了 500 多个真实世界的编辑任务,测量准确率和延迟。
关键事实
- CursorBench 中包含 500 多个真实世界的代码编辑任务。
- 顶级模型与人类之间存在 15% 的准确率差距。
- 测试的模型之间延迟差异高达 3 倍。
- 涵盖 Python、JavaScript、TypeScript 和 Go。
- 首个针对智能体多文件编辑的基准测试。
Epoch AI 发布了 CursorBench,这是一个旨在评估 AI 驱动代码编辑工具(如 Cursor、Claude Code 和 GitHub Copilot)的新基准测试。该基准测试涵盖了从真实世界拉取请求中衍生的 500 多个任务,同时衡量编辑的正确性和执行速度。
CursorBench 填补了 SWE-bench 和 HumanEval 留下的空白,后者测试的是孤立的代码生成,而非迭代式编辑工作流。该基准测试的任务集包括跨 Python、JavaScript、TypeScript 和 Go 的 bug 修复、功能添加和重构。每个任务提供一个代码库快照、一条自然语言指令以及一个真实差异。早期结果显示,顶级模型与人类表现之间存在 15% 的准确率差距,模型间的延迟差异高达 3 倍。该基准测试还衡量编辑精度——模型是否引入了非预期的更改。Epoch AI 计划发布排行榜和一个公开评估工具。
为什么这个基准测试很重要
CursorBench 的出现正值 AI 代码编辑器从自动补全转向智能体多文件编辑之时。估值超过 90 亿美元的 Cursor 最近宣布了一个从零开始为代码生成训练的 GPT 级别模型。Claude Code 和 GitHub Copilot 也瞄准了相同的工作流。CursorBench 为这一新兴类别提供了首个标准化测试,可能成为代码编辑智能体的事实标准。
它是如何运作的
任务来源于带有已验证拉取请求差异的开源仓库。模型接收 PR 之前的仓库状态,并必须输出正确的差异。评估包括精确匹配、编辑距离以及通过测试套件进行的功能正确性。延迟是端到端测量的,包括推理和上下文加载。Epoch AI 的方法论与 SWE-bench 相似,但专注于日常开发中更小、更频繁的编辑——而非整个仓库的补丁。这使得 CursorBench 更能代表实时编码助手的使用场景。
关键要点
Epoch AI 发布了 CursorBench,一个包含 500 个任务的 AI 代码编辑器基准测试。它揭示了与人类相比 15% 的准确率差距以及 3 倍的延迟差异。
值得关注的点
关注预计两周内发布的第一个公开 CursorBench 排行榜,以及 Cursor 的新自定义模型是否能缩小与人类表现之间 15% 的差距。
除了 CursorBench,Epoch AI 还推出了 MirrorCode,一个测试 AI 能否仅凭行为描述重建整个程序的基准测试。MirrorCode 要求模型基于输入输出示例从头重建软件,旨在衡量自主编码的上限。早期结果显示,即使是顶级模型在超过 500 行的项目上也失败了,凸显了端到端软件生成中的显著能力天花板。