本图谱蒸馏自 LLM 机制可解释性:一条方法谱系(及其 4 篇微观 Topic)。Topic 保留叙事,这里只放当前判断。
Overview
机制可解释性 (MI) 研究的是:把训练好的网络逆向成人类可懂的计算(特征 → 电路 → 算法),而非把它当黑箱做事后相关分析。
这个领域不是沿着单一方法推进的,更像是一串问题逼出来的演化:每一代方法都在补上一代的认识论缺口。
读残差流(能读不能证)→ 证因果·画电路(单位多义)→ 找对单位 / 字典(特征未必忠实)→ 2025 收敛 + 对地基的反思(重心转向「证明忠实/可用/可 scale」)。
自建坐标系(用于给新方法定位):认识论手段 Read→Intervene→Validate × 分析单位阶梯 层→头/神经元→子空间→字典特征→函数/参数,再叠一条时间线。
方法进步主要体现在证据强度上,不是图画得更复杂。判断一个新方法,先问它把 Read→Prove→Fix-unit→Validate 这个循环往前推了哪一步。
Core Concepts
- 叠加: 个特征以非正交方向挤进 维、靠稀疏性压干扰——神经元多义的根因,字典学习存在的理由。
- 残差流:各层加法写入的共享通道;其线性可加性是 lens / DLA / patching 成立的结构前提。
- 线性表示假设 (LRH):特征=方向、可线性组合——lens/SAE/DAS/attribution graph 的共同赌注(非定律)。
- 因果中介 / patching:用 do-干预测组件的 indirect/direct effect,把「相关」升级为「因果」。
- 电路 / induction head:执行某行为的计算子图;induction head 是「机制可被发现且复现」的存在性证明。
- SAE:用过完备稀疏字典从叠加里解出(理想上)单义特征。
- 忠实性:解释是否真反映模型计算,是这条线最硬的约束。
- post-hoc vs intrinsic:事后逆向 vs 设计即透明。
Established Knowledge
跨多篇 survey / 论文交叉验证的「事实」层(区别于心智模型与赌注)。
- 残差流可加 ⇒ 中间层可用 unembedding 直接读 — evidence: Logit Lens、lens-methods-cn(Logit/Tuned Lens/DLA 同地基)。
- 读取是相关性的,证因果必须干预 — evidence: circuits-and-interventions-cn;ROME 的 causal tracing + 定位→编辑闭环。
- 真实电路可被(半)自动发现并量化验证 — evidence: IOI(faithfulness/completeness/minimality 三判据)→ ACDC 自动化 → EAP 提速。
- superposition 是稀疏度驱动的相变,可在 ground-truth toy model 复现 — evidence: Toy Models。
- SAE 能把激活解成更可解释的近单义特征(feature ≫ neuron 可解释) — evidence: Towards Monosemanticity;但 proxy 指标(重构/L0)不迁移到下游可解释性(SAEBench),见 features-and-superposition-cn。
- 2025 三条线收敛进 feature 级、可 scale 到生产模型的 attribution graph — evidence: Circuit Tracing(cross-layer transcoder 替身模型)。
Active Debates / 赌注(诚实边界)
- 单位之争:特征是不是对的原子?激活字典 vs 参数分解(SPD,目前仅 toy model)vs 非线性/多维表示——未决。
- LRH 在 frontier 尺度是否成立:circular/多维特征、feature splitting/absorption 是它漏气的信号;多数 survey 当定论,本 vault 当可证伪赌注。见 Linear-Representation-Hypothesis。
- 因果抽象的有效性:Non-Linear Representation Dilemma 证明 featurizer 容量不受限时对齐搜索空洞,直击 DAS;电路分解非唯一(identifiability / streetlight effect)。见 Faithfulness。
- 干预 ≠ 理解:steering(RepE)/ 编辑(ROME)能改行为,不等于读懂机制——应用层最易犯的偷换。
- 理解→效用闭环:可解释性能否在真实安全审计里赢过便宜黑箱基线,待 alignment auditing 这类可证伪实验回答。
相关 domain / 笔记
- 既有可解释性工作:Brewing→Resolution(Owner 本人)、Circuit Lasso、Inference Manifolds(后两者属参数/函数空间支线,与 APD/SPD 同源)。
- 项目:survey 主计划 / 进度(内部跟踪,未公开)。