Code-MUE: 用执行行为来度量代码大模型的不确定性
论文信息
论文信息
- 作者:Xiaoning Ren, Yinxing Xue, Lei Ma, Yuheng Huang
- 发布:2026-07-14T02:23:17Z
- 原文:arXiv:2607.12273
摘要
代码大语言模型(Code LLMs)正成为现代软件工程的核心,但它们的随机性(inherent stochasticity,即每次输出可能不同)带来了真实风险——即使一个微小的错误,也可能导致严重功能、安全或可靠性问题。想要实现可靠的自动化,我们必须能区分“有把握的正确预测”和“瞎蒙”。然而,现有的不确定性估计方法存在一个关键缺口:白盒和灰盒技术(需要模型内部信息)通常不适用于闭源模型,而标准的“黑盒”(black-box)文本度量标准又无法捕捉代码特有的脆弱性——代码中语法变化并不总是意味着语义分歧。为了解决这个“语法-语义鸿沟”,我们提出了 Code-MUE,一个纯粹黑盒的框架,它通过基于执行的语义交互图(Execution-based Semantic Interaction Graphs)来度量不确定性。与那些依赖表面文本相似度的老方法不同,Code-MUE 把不确定性建立在可观察的运行时行为上:它计算解空间的冯·诺依曼熵(Von Neumann entropy,一种信息熵,用来衡量全局语义多样性)。我们在八个最先进的代码大模型上做了大规模实证研究,结果表明:Code-MUE 与功能正确性之间存在很强的负相关(斯皮尔曼相关系数最高达 -0.98),性能远超基于词汇和嵌入的基线方法,并且在实际工作流中能支持稳健的风险检测和选择性预测。