我估算:读代码的成本是写代码的2.1倍
根据我的估算,人类审查一行代码改动的成本约为0.243美元,而AI智能体生成一行通过基准测试的代码,模型花费仅约0.114美元。在这些假设下,人工审查成本约为AI生成成本的2.1倍。本文详细拆解了两者的计算过程和依据。
估算背景
这个估算的出发点是:AI编程智能体已经能自动产出代码,但人工审查仍然是必要环节。哪个更贵?我根据公开数据做了一次粗略测算。
智能体成本来自2026年5月的一次公开GPT-5.5 OpenHands运行。OpenHands是一款AI编程智能体,这次运行在SWE-bench Verified基准上进行了500次尝试。我按照GPT-5.6 Sol当前的API费率,重新计价了运行中实际消耗的token数量,从而推算出每行“通过补丁”的成本。
人工审查:每行0.243美元
人工审查成本主要由两项数据决定:审查速度和开发者工资。
SmartBear/Cisco的一项研究分析了超过2500次代码审查,涉及320万行代码。研究发现,当审查速度达到每小时300-500行(LOC)时,缺陷检测率会下降。我取中间值:每小时审查400行。
美国劳工统计局(BLS)报告,2025年5月软件开发者的工资中位数为每小时65.38美元。BLS 2026年3月的雇主薪酬数据显示,私营企业专业及相关职业的福利占总薪酬的32.7%。也就是说,企业雇用一名开发者,除了工资还要支付福利,实际时薪需要按这个比例折算。
计算过程如下:
含福利时薪 = $65.38 / (1 - 0.327) = $97.15
每行代码审查成本 = $97.15 / 400 = $0.243
所以,在每小时审查400行、含福利时薪97.15美元的假设下,每审查一行改动的代码,企业需要付出约0.24美元。
AI智能体:每行通过补丁0.114美元
OpenHands公开了完整的GPT-5.5 SWE-bench Verified运行记录。它使用OpenHands v1.18.1,搭配GPT-5.5高推理强度,尝试了全部500个基准任务。
我统计的“改动行数”是每个统一diff中新增行和删除行之和,不包括+++和---文件头行。所谓“通过”,是指该任务被SWE-bench评估器标记为已解决。
这次运行解决了500个任务中的391个。但有一个成功结果(psf__requests-1142)非常特殊:它包含了16180行改动,而其余最大的五个成功补丁分别只有136、129、86、81和79行。
这个离群补丁占了所有成功改动行数的76%。如果把它算进去,整体成本会从每行0.114美元降到0.027美元,这显然不能反映真实情况。所以我在计算时把它作为离群值移除,下面同时报告两种情况。
剔除这个离群值后,剩余499次尝试共消耗了651,273,155个token,总花费为577.48美元。结合通过任务的改动行数,折合每行通过补丁的成本约为0.114美元。
结论:人工审查更贵
在以上假设下,人工审查一行代码改动的成本,是AI生成一行通过代码成本的2.1倍。这只是一个估算,实际数字会因团队效率、审查严格程度、模型价格等因素而有所不同。