程序员对 LLM 生成的断言判断能力差且过度自信

arXiv cs.SE 2026-07-13T04:56:54.325308

论文信息

论文信息

程序员对 LLM 生成的断言判断能力差且过度自信

摘要

代码理解和代码审查已经是至关重要的软件工程任务,而 AI 代码生成工具的日益普及更是提升了其重要性。生成式 AI 有潜力支持这些活动,例如通过为代码添加断言以及描述代码行为的自然语言解释来增强代码。然而,关于这种支持可能有多有效,我们知之甚少。我们针对 86 名 Python 程序员进行了一项对照实验,并开展了后续的有声思维研究,以考察开发者评估不同质量生成的断言的正确性和完整性的能力,并探究自然语言解释如何影响这些评估。尽管程序员在一定程度上能够准确判断正确的断言(准确率 74%),但在面对错误的断言时,他们的表现很差(准确率 49%),尽管对两种判断报告了相似的信心水平。这种判断准确性的差异具有统计学显著性(p < 0.001):开发者准确判断正确断言的几率几乎是准确判断错误断言的 3 倍(OR = 2.94)。令人惊讶的是,断言的自然语言解释并未带来整体上的好处。此外,低质量的解释可能会损害规格说明评估的准确性(p = 0.037,OR = 0.58),同时增加开发者的信心(p = 0.005,3.99/5 对比 4.25/5)。我们的发现表明,与常见假设相反,AI 辅助可能不会提高代码理解和代码审查的可靠性。更广泛地说,我们的发现强调了帮助开发者评估机器生成的可信度相关工件的重要性,而不仅仅是生成它们。

查看原文