概念 | 可解释性研究的两条范式路线:post-hoc 对已训练好的固定模型「事后」逆向分析;intrinsic(by-design)则在架构与训练里注入归纳偏置,让模型「天生」就透明。
是什么
面对一个神经网络,想知道「它内部到底在算什么」,有两种根本不同的切入方式。
Post-hoc(事后可解释性):把模型当成一个已经训练好、参数固定的黑箱,然后在外部施加各种探查手段去推断它的内部计算。绝大多数主流 mechanistic interpretability 工具都属于这一类——比如用 Logit Lens 把中间层激活投影到词表去「读」中间预测、用 Activation Patching 替换某些激活看输出怎么变、用 Sparse Autoencoder 从激活里无监督地拆出可解释 feature。关键特征是:模型本身完全不变,解释是事后附加的。
Intrinsic / by-design(内生可解释性):不在事后补救,而是在设计模型时就把「可被人理解」当作一等目标,通过架构选择和训练约束把透明性「烤进」模型本身。典型如 concept bottleneck model(强迫信息先经过一层人类可命名的概念,再做预测)、interpretable / modular MoE(让不同专家承担可辨认的子功能)、weight-sparse transformer(约束权重稀疏,使每个神经元/连接的作用更孤立可读)。关键特征是:模型结构本身就是它的解释,无需外部逆向。
一个粗略类比:post-hoc 像对一台已造好的发动机做拆解、打标记、测信号;intrinsic 像一开始就用透明外壳、模块化零件来造发动机。
为什么重要(动机)
这两条路线之所以值得单独立一个概念,是因为它们对应着对「解释到底可不可信」这一根本问题的两种态度,而这正是理解后续所有具体方法的前置框架。
Intrinsic 阵营的核心论点是 post-hoc 存在 fidelity gap(忠实性鸿沟):事后解释是「外挂」上去的近似,它讲述的故事不保证就是模型真实的因果计算过程。一个 explanation 可以看起来很合理、很流畅,却与模型实际依赖的机制不符——这正是 Faithfulness 关注的核心隐患。既然如此,与其事后费力地去逼近一个可能永远逼不准的真相,不如从一开始就让模型的计算结构与人类可理解的结构对齐,从源头消除这道鸿沟。
反过来,post-hoc 阵营的动机也很实在:我们真正想理解和部署的,恰恰是那些为性能而生、没有任何可解释性约束的前沿大模型(GPT、Claude 这类)。它们已经存在、已经强大,intrinsic 的「重新设计」对它们无能为力。因此理解一个工具属于哪一类,直接决定了它的适用范围与可信度边界。
关键细节
-
Intrinsic 的五类设计原则(大意,非严格分类)。文献里 by-design 透明的手段大致可归为几个方向:(1) concept bottleneck / 概念瓶颈——强制预测经过人类可命名的中间概念层;(2) modularity / 模块化——把功能拆给可辨认的子模块(如 interpretable MoE、routing 可读的专家);(3) sparsity / 稀疏性——约束权重或激活稀疏(weight-sparse transformer),使每个单元作用孤立、减少 Superposition;(4) prototype / case-based——预测基于「与某个可展示原型的相似度」;(5) monotonicity / 结构先验——施加单调性等可审计的函数形式约束。这些原则常常组合使用。〔已知方向,但具体边界在文献中并无统一划法——此处为归纳性概括〕
-
Transparency–performance 权衡(争议)。传统观点认为加约束会损失容量、牺牲精度,所以「可解释 vs 准确」是一道取舍。但这条权衡有多陡峭、是否本质存在,是有争议的:一种观点(如 Rudin 等人提倡)认为在很多任务上设计良好的可解释模型几乎不损性能,所谓权衡被高估;另一种观察则是在前沿 LLM 规模上,强可解释性约束目前确实还难以不掉点。〔争议,证据随任务与规模而异〕
-
「可解释外观」≠ 因果忠实。这是对 intrinsic 最重要的批判。一个 concept bottleneck 即使有一层叫「概念」的单元,也不保证模型真的「通过这些概念」做决策——可能存在 concept leakage(概念层偷偷编码了概念之外的信息),使得人看到的解释只是表象。换句话说,by-design 把解释结构摆在明面上,但不自动等于这个结构就是真实因果路径。要确认这一点,仍然需要 post-hoc 式的因果检验(如 Causal Mediation / Activation Patching)。所以两条路线并非互斥,往往需要 intrinsic 提供结构、post-hoc 验证忠实。
-
规模验证的不对称(边界条件)。Intrinsic 方法的多数强结果集中在中小规模模型与较窄任务上;它们能否在前沿规模的通用 LLM 上保持透明又不显著掉点,目前证据有限。Post-hoc 工具则反过来——天然适配大模型,但要持续与 fidelity gap 搏斗。理解一个 claim 是在哪个规模、哪类任务上做出的,是评估它的关键。〔已知 vs 推测的分界点常在此〕
与其他概念的关系
- 整个 post-hoc 阵营的工具谱系——Logit Lens、Patchscopes、Activation Patching、ACDC、 SAE——都建立在「不改模型、事后逆向」的前提上;本 note 给它们提供共同的范式标签。
- Faithfulness 是连接两条路线的枢纽概念:intrinsic 用「post-hoc 不忠实」作为立论起点,而验证 intrinsic 自己是否忠实又要回到 post-hoc 的因果检验,二者互为镜像。
- 稀疏性这一设计原则与 Superposition、Polysemanticity 直接相关:weight-sparse / activation-sparse 设计本质是想从训练源头抑制叠加与多义,让单元天生 monosemantic——这与 SAE 事后拆解叠加的目标殊途同归,一个在训练时防、一个在推理后治。
- 因此本 note 不主张「哪条路线更对」,而是提供一个判别每个具体方法「站在哪一侧、因此受哪种局限约束」的坐标轴。