[2606.26492] 深度学习程序故障诊断中的评估-策略差距

arXiv cs.SE 2026-06-26T09:28:37.117327

[2606.26492] 深度学习程序故障诊断中的评估-策略差距

作者: Sigma Jahan

[提交于 2026年6月25日]

摘要: 深度学习(DL)程序在训练过程中可能因多种原因失败,而诊断故障原因是一项代价高昂且耗时的维护任务。评估这类故障诊断技术通常采用程序内交叉验证,但这种方法可能不适用于涉及未见过程序的部署场景。因此,有必要评估这些设置间性能的差异,并找出既有深度学习故障诊断技术中性能差距的根源。我们使用 DynFault(一个包含 38 个真实世界 DL 程序的 5,542 条注入故障的训练轨迹语料库)调查了这一差距。我们发现,既有故障诊断技术在程序内评估与保留整个程序评估之间的平衡准确率存在 0.190 的差距。我们还发现,这一差距源于特征中的程序级结构,这促使我们研究了两种运行时特征集——曲率特征和优化器特征,以及它们在未见过程序上的行为。我们发现,曲率特征对于在未见过程序上进行不稳定性检测是有用的,而优化器和激活特征仅在训练期间见过的程序上有帮助。

查看原文