[2606.24952] 完美检测,控制失败:语言模型中"知道"与"操控"的几何学
[2606.24952] 完美检测,控制失败:语言模型中"知道"与"操控"的几何学
作者: Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio
摘要: 机制可解释性(mechanistic interpretability)的一个核心追求是可控性(controllability):如果我们知道某个行为在模型激活值中的表征位置,就应该能够修改它。这基于一个隐含的前提——检测行为的向量方向与控制行为的向量方向是相同的,或者非常接近。我们通过几何方法对此进行检验:最佳检测某个行为的方向与最佳引发该行为的方向之间的夹角是多少?如果检测意味着控制,那么余弦值接近于1;否则,该余弦值量化了检测-干预之间的差距。在 Gemma 2-2B-it 上,输出格式(干净的 JSON vs Markdown 围栏)使这两个角色合并到同一轴上。但幻觉(hallucination)并非如此:模型以完美的线性可分性检测虚假实体(从第5层开始 AUC = 1.000),然而该方向与产生拒绝(refusal)的方向之间的夹角余弦为 0.12(约83度)——这是一个微小、可复现的对齐程度,远非"检测即控制"所需的 cos = 1。一个仅由激活值构建、不依赖任何选定词元的检测器,同样无法对齐(cos = -0.06)。这种差距具有普适性:在来自三个模型家族、两种规模(1B-9B)的四个模型上,余弦值稳定在 [0.12, 0.20] 之间,且在指令微调前后保持一致(0.1197 vs 0.1200),表明其根源在于预训练。朝向拒绝方向旋转15度可以部分弥合这一差距——在两个保留的虚假实体类别上,以1.8%的假阳性率实现了73%和60%的拒绝。接着我们探究该余弦值是否可预测可操控性(steerability),结果是否定的:检测是一个高维类别(high-dimensional class),而非单一方向;区分可操控情况的因素是功能性的,无法从静态角度读取。余弦值是可计算的、表征"知道"与"操控"之间分离的权重签名(weight-computable signature),而非其预测因子。