概念 | 一个解释(circuit / feature / 自然语言 rationale)是否真实反映了模型实际用来产生输出的计算,而非只是「看起来合理但其实错了」(plausible-but-wrong)。

是什么

Faithfulness(忠实性)回答一个朴素却致命的问题:我给出的解释,是模型真的在做的事吗?

设想我们声称「模型识别句子主语,靠的是第 8 层第 3 个 attention head」。这是一个 claim。它可能:

  • plausible(看起来合理):head 的注意力图确实集中在主语 token 上,人类一看觉得「对,就是它」;
  • faithful(忠实):如果我们真的去破坏这个 head,模型识别主语的能力确实会塌掉;如果我们只保留这条路径,模型还能完成任务。

两者并不等价。一个解释可以高度 plausible 却完全 unfaithful——注意力图好看,但 ablate 掉它模型行为纹丝不动(说明真正干活的是别处)。Faithfulness 的核心判据因此是因果的,而非观感的:解释必须经得起干预(intervention)的检验,而不是仅仅能讲一个动听的故事。

形式上常把忠实性拆成两个互补的性质:

  • Necessity(必要性):移除解释所指认的成分(component / feature / path),模型在该任务上的表现应当显著下降。若移除后毫无变化,说明这些成分对该行为并非必要——解释抓错了对象。
  • Sufficiency(充分性):只保留解释所指认的成分、消融掉其余部分,模型应当仍能完成任务。若不能,说明解释不完整,遗漏了真正参与计算的部分。

两者合起来逼近 completeness(完整性):解释既不多指(necessity)也不漏指(sufficiency)。

为什么重要(动机)

忠实性是 interpretability 整个评估体系的地基。原因有三:

1. 不忠实的解释比没有解释更危险。 一个 plausible-but-wrong 的解释会给人虚假的安全感——你以为理解了模型、以为知道它何时会出错,于是基于错误的 mental model 去做部署、对齐或安全决策。过时或错误的认知,比承认无知更危险。

2. 它是区分「描述」与「因果」的分水岭。 大量解释方法(attention 可视化、feature 命名、自然语言 rationale)天然是相关性或事后叙事,容易被人类的模式补全能力「脑补」成因果。忠实性强迫我们把 claim 降级为假设,再用干预去证伪。

3. 它定义了什么算「评估成功」。 没有忠实性标准,任何解释都可以自说自话。有了它,circuit / feature 的发现才有可证伪的成败判据——这是把 interpretability 从「讲故事」推向「做科学」的关键。

关键细节

1. 基于干预的假设检验:causal scrubbing。【已知】忠实性的检验天然落在因果干预上——见 因果中介分析Activation Patching。Anthropic 提出的 causal scrubbing 是其中一种系统化协议:把一个 circuit 假设形式化为「哪些激活承载哪些信息」,然后做保持行为不变的重采样(resampling)——只要假设为真,把无关激活替换成同分布的其它样本,模型输出就应当(在分布意义上)保持不变。如果替换后行为变了,说明假设漏掉了真正参与计算的路径,忠实性不成立。它的特点是只能证伪、不能证真:通过了 scrubbing 只意味着「尚未被推翻」,而非「已被证明」。

2. SAE 特征是否因果忠实,是当前争议焦点。【争议】 SAE 能从激活里抽出大量看似单义(monosemantic)的 feature,命名起来非常 plausible。但「这个 feature 看起来代表概念 X」与「模型真的用它来计算 X」是两回事。已有工作发现:SAE feature 在重建损失上表现好,不代表它们在因果上对应模型实际使用的计算单元——可能存在 feature splitting、dead features、以及 SAE 字典本身引入的、模型并不「使用」的人造方向。因此「SAE 找到了真特征」这一 claim 必须用干预(ablate 该 feature 看行为是否按预期变化)来验,而非靠名字好听。这是 Towards Monosemanticity 之后社区持续争论的问题,也是 参数空间分解 等路线试图绕开 activation-SAE 局限的动因之一。

3. Identifiability 与电路非唯一性,冲击「忠实=唯一真相」的预设。【争议,2025 起】一个隐含假设是:存在唯一一个忠实的解释/电路,我们的任务是找到它。但越来越多证据指向非唯一性——同一行为可能由多个在因果检验下都「通过」的不同 circuit 描述(不同粒度、不同成分组合、甚至冗余/并行的路径都能各自满足 necessity+sufficiency 到某个阈值)。这与 superposition 下表示的不可唯一分解(见 线性表示假设 的边界讨论)相呼应。其后果是:忠实性不应被理解为「逼近唯一真相」,而更像「在某个抽象层级上与模型计算因果一致」——同一现象允许多个都忠实但互不相同的解释。这要求我们在做 claim 时显式声明抽象层级容差阈值,否则「忠实」一词会被偷换成「我的解释是对的」。

4. 常见误解。

  • 误解一:「可视化好看 = 忠实」。观感属于 plausibility,与忠实性正交。
  • 误解二:「通过了因果检验 = 被证明正确」。干预检验本质是证伪工具,通过只代表未被推翻。
  • 误解三:「忠实 = 完整」。一个解释可以忠实地描述计算的一部分(局部 necessary)却不 sufficient(不完整);忠实与完整是两个轴。

与其他概念的关系

  • 因果是忠实性的检验手段:忠实性的所有硬判据都落到干预上,方法层面见 因果中介分析Activation PatchingACDC(自动化电路发现本身就以 necessity/sufficiency 为目标函数)。
  • 被检验的对象:忠实性是评估 Circuits稀疏字典学习 抽出的 feature、以及各类解释方法(事后解释 vs 内在可解释)是否可信的统一标尺;典型电路案例如 IOI Circuit 的可信度,正是靠忠实性检验建立的。
  • 表示层的张力:忠实性的「非唯一」困境根植于表示本身可能不可唯一分解——见 线性表示假设 及其在 superposition 下的边界。
  • 与 plausibility 对立而非同义:人类觉得「合理」的解释(自然语言 rationale、注意力热图)恰恰最需要忠实性来边界校准——这是把 interpretability 当科学而非叙事的分界线。