Know2Guess: 面向大语言模型知识边界评估的污染感知多区域基准

arXiv cs.CL 2026-06-26T09:28:37.085940

Know2Guess: 面向大语言模型知识边界评估的污染感知多区域基准

作者: 任伟孟,张博文,王健,王希灿,吴昊毅,邱宣岩,杨圣安

提交日期: 2026年4月30日

摘要: 对大语言模型(LLM)的可靠评估应区分基于支持的作答与无依据的猜测,同时避免将数据污染、提示特异性或通用拒绝行为混为一谈。我们提出了一种污染感知的多区域基准,用于在冻结构建时标签下测量从可作答知识到应弃权未知的转换过程。该基准包含跨越五个领域的1200个条目,具有明确的弃权预期、污染风险元数据,以及双重解析机制(官方严格解析器加标准化鲁棒解析器)。我们在锁定作答或弃权提示、仅作答控制提示以及提示模板变体下评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型。该基准无法通过通用非作答行为解决:FLAN基线在有效弃权方面仍然薄弱,而更强的指令微调模型则暴露出从作答到弃权的选择性但非完全的转换过程。Qwen2.5-3B-Instruct在整体可靠性上表现最佳,但预期作答区域仍具挑战性,校准效果依然较差,且良性条目拒绝问题持续存在。提示和解析器鲁棒性分析保留了主要排序和定性结论。因此,该基准为审核LLM可靠性的不同但相互作用的维度(可答性、弃权、拒绝和污染)提供了可复现的协议。数据集公开于此HTTPS链接

查看原文