Web-Bench:基于Web标准与框架的LLM代码基准测试

www.semanticscholar.org 2026-06-28T18:21:15.063652

大语言模型(LLM,Large Language Model)在编程领域的应用正在快速发展:从代码助手,到自主编码代理,再到通过自然语言生成完整的项目。早期的LLM代码基准测试主要关注代码生成的准确性,但这些基准测试已逐渐趋于饱和。基准饱和削弱了它们对LLM的指导作用。例如,HumanEval上的Pass@1已达到99.4%,MBPP达到94.2%。在解决基准饱和问题的各种尝试中,基于软件工程的方法脱颖而出,但现有软件工程基准的饱和程度正在迅速上升。为解决这一问题,我们提出一个新的基准——Web-Bench,它包含50个项目,每个项目由20个具有顺序依赖关系的任务组成。

查看原文