哪些神经元检测恶意代码?LLM安全知识的探测研究

arXiv cs.SE 2026-07-14T05:51:46.620296

论文信息

论文信息

摘要

背景:大型语言模型(LLM)在理解和生成源代码方面已展现出越来越强的能力,从而在代码补全、修复和漏洞检测等软件工程任务中得到广泛应用。然而,尽管其实验性能强劲,LLM 识别恶意或易受攻击代码模式的内部机制仍知之甚少。目标:我们研究了恶意代码检测行为在 LLM 前馈网络(FFN)神经元中的编码位置,并通过因果干预验证了已识别神经元的归因。这旨在识别检测恶意代码时最重要的神经元。方法:我们应用机制可解释性方法,在三个指令微调的 LLM(Llama3.1-8B-Instruct、Mistral-v0.3-7B-Instruct 和 Qwen2.5-7B-Instruct)中定位负责恶意代码检测行为的神经元。使用来自 PyPI Malregistry 的 1500 个恶意和 1500 个良性 PyPI 包,我们将该行为归因于一组神经元。结果:实验结果表明,放大促进恶意代码检测的神经元同时抑制阻碍它的神经元可以提高准确率,而反向操作则使预测坍缩为单一类别,尽管幅度和一致性高度依赖于模型。我们证明了防护栏检测机制在不同模型间存在差异,每个模型在其 FFN 层中以不同方式表示恶意代码检测行为。结论:探测与安全相关知识相关的神经元有助于我们深入了解 LLM 如何编码恶意编程概念,识别潜在有害的记忆行为,从而为面向代码的 LLM 的更可靠防御机制(如神经元级编辑、选择性遗忘和安全感知对齐)铺平道路。

查看原文