AI编码代理编写的代码量增加180%但实际发布的软件仅增加30%

日本东京——2025年2月3日:Open AI首席执行官Sam Altman在东京举行的“通过AI转型商业”活动中与SoftBank集团首席执行官孙正义(Masayoshi Son)进行对话。SoftBank和OpenAI宣布已达成合作协议,将在日本成立人工智能服务合资企业。(图片来源:Tomohiro Ohsumi/Getty Images)
编码代理(AI Coding Agents)已几乎超越两年前存在的所有软件基准测试,风险投资也随之做出了反应。但一项涵盖超过10万名开发者的新MIT研究显示了一个基准测试无法看到的效率差距:AI代理将编写的代码量提升了约180%,而实际发布到生产环境的代码量仅增长了约30%。编写与发布之间的差距,正是真正的AI投资故事所在。
自Cognition的Devin于2024年初推出并在SWE-Bench标准软件基准测试中仅解决13%的任务以来,风险投资已将数十亿美元投入AI编码工具。18个月后,最好的代理在同一测试中的得分已高达80%以上,这种改进速度让许多投资者相信软件工程已是一个被解决的市场。Conviction的创始人Sarah Guo本周指出,投资界从这一轨迹中得出的恰恰是错误的教训。
“几乎所有人都得出了同一个错误的结论:模型吞噬了软件工程,”Guo写道。“但当模型吞下软件工程中最可衡量的部分时,我们正在重新认识许多团队已经知道的事实:工程学一直以来都难以衡量,而最可衡量的部分或许并非唯一重要的部分。”
MIT的数据解释了原因:代码生成近乎零成本即可验证——编译器要么接受输出,要么拒绝,测试套件要么通过要么失败。当验证成本为零时,模型可以针对检查项进行数百万次训练,直到击败它为止。但无法低成本验证的是:某个改动是否对特定生产系统(一个拥有未记录依赖关系和无人值守部署管道的十年老代码库)而言是正确的改动。这种正确性无法通过排行榜读出,只能通过让系统在实际负载下长时间运行来确认——这是一个任何模型能力提升都无法缩短的时钟周期。