Summary

Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations (DAS)

  • 核心: 把”高层因果变量对齐到神经网络哪一块表征”这件事,从离散暴力搜索 + 假定 basis-aligned(一个变量对应一组互斥神经元)的两难里解放出来——用梯度下降学一个正交旋转 R,把高层变量对齐到旋转后子空间(一个非 basis-aligned 的分布式 mediator),再用 interchange intervention 在该子空间上验证因果抽象关系。
  • 方法: distributed interchange intervention(DII,软干预:旋转→在正交子空间上 patch→旋转回去)+ 以 interchange intervention accuracy(IIA)为可微目标,冻结高/低层模型只学 R。
  • 结果: 在 hierarchical equality 与 MoNLI 两个 toy 任务上找到 brute-force / localist 都找不到的 100% IIA 对齐;并用 subspace-DAS 区分”真·抽象关系”与”伪装成关系的数据结构”。
  • Sources: paper | github
  • Rating: 3 - Foundation(监督式因果抽象/对齐验证这条线的旗舰原型,催生 Boundless DAS、pyvene、RAVEL 等一系列后续;但 2025 Non-Linear Representation Dilemma 对其根基提出质疑)

Key Takeaways:

  1. 两个旧限制 → 两个新解法:旧 causal abstraction 方法 (1) 要在对齐空间里暴力搜索、(2) 假定高层变量对齐到互斥的一组神经元(localist)。DAS 分别用 gradient descent over rotationsdistributed(重叠、非轴对齐)子空间破掉它们。
  2. 关键 insight 来自线性代数:在一个把输入旋转 20° 的线性网络里,“标准基下找不到对齐”是 basis 选错导致的伪结论——把隐表征反旋转 20° 就出现完美对齐。神经元与概念是 many-to-many,换个基就能露出可解释维度(Smolensky 1986)。
  3. IIA 是可微的、graded 的验证指标:interchange intervention accuracy = 高/低层 interchange 效果一致的比例,被 [Geiger et al. 2023] 在 approximate causal abstraction 理论里 grounding;DAS 直接把它当 loss 优化 R。
  4. 诚实的反面控制:在随机初始化的网络上,只要隐层维度远大于输入维度,DAS 也能把 IIA 推到 0.64——说明方法有足够容量”找出”并不被模型功能性使用的结构。这正是 2025 Non-Linear Representation Dilemma 质疑的种子。

DAS(distributed alignment search)属于机制可解释性中”因果抽象/对齐验证”这条线:它不像 Logit Lens 那样读表征、也不像 SAE 那样无监督拆特征,而是先假设一个高层符号算法(causal model),再用因果干预去验证神经网络是否实现了它。本文是这条线把”对齐搜索”从手工/暴力升级为可微监督搜索的原型工作。

问题设定:causal abstraction 与它的两个瓶颈

Causal abstraction 框架问的是:一个复杂低层因果系统(神经网络 )是否”实现”了一个简单高层因果系统(符号算法 )?判定的基本操作是 interchange intervention(即 activation patching):给网络一个 base 输入,把某组神经元强制设成它们在处理另一个 source 输入时会取的值,看输出的反事实行为是否与高层模型一致。

形式化的判定是 constructive causal abstraction:在给定对齐 下,对所有输入 与干预

其中 把低层值映射到高层值。实践中很难完美成立,于是用 interchange intervention accuracy (IIA)——干预效果一致的比例——作为 graded 版本,并被 approximate causal abstraction 理论支撑。

旧方法的两个痛点(本文要解决的 delta):

  1. 对齐靠暴力搜索:要在”高层变量 ↔ 哪些低层神经元”的离散空间里 brute-force,组合爆炸,不可行时只能放弃,可能直接错过最优对齐。
  2. localist 假设:假定每个高层变量对齐到一组互斥(disjoint)的标准基神经元。但分布式表征里神经元是 many-to-many 的(superposition / polysemanticity),没有先验理由认为概念恰好沿坐标轴排列。

核心 insight:换个基,伪结论就消失

论文用一个 boolean conjunction 的线性玩具网络说明:权重把二维输入旋转 。在标准基下,把高层变量 对齐到隐单元 做 interchange intervention,反事实行为不一致——看起来”网络没实现这个算法”。但这是 basis 选择导致的 spurious 结论:只要把隐表征旋转 得到新坐标 (旋转矩阵恰是权重的逆,线性网络无激活,旋转”撤销”了权重变换), 就分别等于第一、第二个输入参数,对齐变成完美。

这说明:可解释的结构可能存在于一个非神经元对齐的基里。localist 方法因为只在标准基里找,会系统性地漏掉它。

方法:distributed interchange intervention (DII)

把”换基 + 子空间 patch”形式化为一个软干预:先用可逆函数(本文用正交旋转) 把目标神经元 变到向量空间 被正交分解成 ;在旋转后空间上,base 的某些子空间维度被替换成各 source 在对应子空间的值,其余()保留 base,最后旋转回去:

符号说明 base 的 total setting; 个 source 输入; 投影到子空间 是保留 base 的”残余”子空间。含义:这是个保留因果依赖的软干预——只在被对齐的正交子空间上替换,而非整组神经元硬 patch;当 且子空间沿坐标轴时,DII 退化为普通(localist)interchange intervention。

下图是多 source DII 的完整流程:base(红)与两个 source(绿/蓝)各自前向得到 total setting,三者隐表征都用同一个 旋转到 ;在 base 的旋转表征上,把两个子空间维度分别固定成绿、蓝 source 的值;再用 旋转回去,前向算出反事实输出。DAS 的全部学习量就是这个

Figure 1. 一次 generic multi-source distributed interchange intervention(绿/蓝为两个 source,红为 base,底部为反事实结果)

DAS:把对齐搜索变成梯度下降

既然干预是可微的,就能把”找最优对齐”变成”学最优旋转”。冻结高层模型 和低层网络 ,只对正交矩阵 (用 PyTorch 的可微正交参数化)做 SGD,目标是让低层 DII 的(经 push-forward 的)输出分布逼近高层 interchange 的输出分布,用交叉熵:

仍保留的离散超参——干预哪层神经元、每个高层变量占多少维子空间。验证指标 IIA 则是对齐后 interchange 效果一致的比例(与上式同构,只是把 CE 换成相等判断)。

❓ 关键张力: 是被高层模型监督着学出来的——它在”发现”模型已有的结构,还是在”塑造”一个能让 IIA 变高的对齐?这正是下面随机网络控制要回答的,也是后续争议的核心。

实验一:Hierarchical Equality

任务 :判断两对物体的相等关系是否一致。训三层 ReLU 前馈网,behavioral 100%。高层假设:网络先算左相等 、右相等 两个中间变量,再合成最终标签(认知科学里默认的解法)。另设两个对照高层模型:只表示左对的相等关系、以及只编码第一个输入物体的 identity。

Table 1. Hierarchical equality 对齐结果(cell = 训练集 IIA,三 seed 取最优)

设置Both Equality (L1/L2/L3)Left Equality (L1/L2/L3)Identity of 1st Arg (L1/L2/L3)Identity Subspace of Left Eq (L1)
|N|=16, k=10.88 / 0.51 / 0.500.85 / 0.54 / 0.500.51 / 0.52 / 0.500.51
|N|=16, k=81.00 / 0.57 / 0.500.90 / 0.56 / 0.500.52 / 0.53 / 0.510.51
|N|=32, k=160.99 / 0.67 / 0.530.99 / 0.65 / 0.500.49 / 0.55 / 0.520.51
Brute-Force Search0.60 / 0.56 / 0.520.64 / 0.64 / 0.570.50 / 0.51 / 0.54-
Localist Alignment0.73 / 0.56 / 0.480.60 / 0.50 / 0.490.46 / 0.47 / 0.48-

读法:DAS 在 ‘Both Equality Relations’ 高层模型 + 第一层 + 足够子空间维度(k=8/16)下拿到 1.00 IIA,而 brute-force 最好只有 0.60、localist 最好 0.73——分布式对齐找到了离散/轴对齐方法系统性漏掉的结构。而 ‘Identity Subspace of Left Equality’(试图把左相等子空间再拆成第一个参数的 identity)始终 ~0.51 ≈ chance:说明网络学的是真·抽象的相等关系,而不是偷偷存了输入物体的身份。

实验一·控制组:随机网络(最重要的 caveat)

在 behavioral 50%(chance)的随机初始化网络上跑 DAS:

Hidden |N| / intervention kIIA (Layer 1)
16 / 80.50
64 / 320.50
256 / 1280.51
1028 / 5120.55
4096 / 20480.64

小网络里 DAS 无法提升 IIA(好消息:它不能凭空造行为);但当隐层维度比输入维度(16)大几个数量级时,IIA 升到 0.64——随机结构足够多时,DAS 能搜出一个旋转把无意义的随机机制”对齐”成可系统操纵反事实行为的样子。作者把这当作”DAS 不能从随机结构造出全新行为”的 sanity check;但反过来读,它暴露了方法的容量本身可能制造 false positive

实验二:Monotonicity NLI (MoNLI)

微调一个预训练 Transformer 解 MoNLI(premise/hypothesis 仅差一个词,判断 entails / neutral,含否定会翻转词汇关系)。DAS 找到对”词汇蕴含关系”这个二值变量的 100% IIA 对齐。但一个诚实的发现:用 subspace-DAS 进一步拆这个”蕴含关系”子空间,发现它可被分解成 两个词身份的表征——也就是说,它看似是个”关系”变量,实则是个装着两个词身份的数据结构(data structure),而非真正编码了二者的蕴含关系。对比之下 hierarchical equality 的相等关系不可分解,是真正从参与实体中抽象出来的。这个对比是本文方法论上最有价值的副产品:高 IIA 不等于”找到了一个语义上正确的抽象变量”,还要追问它能否被进一步分解。


关联工作

基于

  • Causal abstraction 理论 + IIA(Geiger et al. 2021/2023): DAS 直接建立在”interchange intervention 效果一致 ⟺ 因果抽象成立”的判定与 approximate causal abstraction(α-on-average)的 graded 理论上。见 因果中介分析
  • Interchange intervention = activation patching: DII 是 patching 的软化/换基推广; 时退化为标准 patching。
  • Interchange Intervention Training (IIT)(Geiger et al. 2022b; Wu et al. 2022): 用同类目标训模型去实现某高层模型;DAS 复用 IIT 目标,但冻结模型只学对齐
  • 分布式表征思想(Smolensky 1986; Rumelhart/McClelland 1986): many-to-many、换基露结构的直接理论来源,关联 superposition / polysemanticity

对比

  • Brute-force / localist 对齐(本文的 baseline): DAS 在 IIA 上显著超过二者,证明分布式、可微搜索的价值。
  • ROME: 同样用 causal mediation 定位+干预,但 ROME 在标准基/具体权重上做编辑、面向事实知识;DAS 在学到的旋转子空间上做软干预、面向算法变量的验证。
  • ACDC / IOI circuit: 电路发现路线在标准基下找子图/边;DAS 不找电路而是验证一个预设的高层因果变量是否被某子空间实现——是 confirmatory 而非 exploratory。
  • SAE / dictionary learning: 无监督、自下而上拆特征字典;DAS 有监督、自上而下验证假设变量。两者对”特征是否线性子空间”做了同样的赌注(linear representation hypothesis)。

方法相关

  • 后续谱系:Boundless DAS(把 的维度也学出来,scale 到 Alpaca/LLaMA 级)、pyvene(统一干预库,本文 github)、RAVEL(属性解耦评测)都源自这条线。
  • faithfulness:IIA 本质是一种 causal/counterfactual faithfulness 度量。

论文点评

Strengths

  1. 把不可行的离散搜索变成可微优化:brute-force 对齐随网络规模组合爆炸,DAS 用正交旋转的可微参数化 + SGD 直接学对齐,是工程上的关键解锁,也是后续能 scale 到真实 LLM 的前提。
  2. 非 basis-aligned mediator:明确放弃”概念沿坐标轴”的 localist 假设,允许重叠子空间——这与 superposition/distributed representation 的经验事实一致,且 boolean conjunction 的 20° 例子把”为什么标准基会给出伪负结论”讲得极清楚。
  3. graded、有理论支撑的验证指标:IIA 不是 ad-hoc,而是 approximate causal abstraction 的实例化。
  4. subspace-DAS 的可证伪精神:主动去拆”看似关系变量”,发现 MoNLI 的蕴含其实是数据结构——把”高 IIA”和”真抽象”分开,体现了诚实的 critical reading。
  5. 诚实的随机网络控制:作者没有藏 0.64 这个尴尬结果,而是把它当 sanity check 报告出来。

Weaknesses

  1. 随机网络 0.64 是方法论根上的警报:当隐维 ≫ 输入维,DAS 能在无意义随机结构上搜出高 IIA。这说明学到的旋转有足够容量拟合高层模型,而非纯粹发现网络已有的计算。“DAS 找到对齐”与”DAS 制造了对齐”在高容量下难以区分。
  2. 2025 Non-Linear Representation Dilemma 的根本质疑(务必记住):如果允许 featurizer 任意强(非线性),那么几乎任何高层变量都能被”找到”编码在激活里,对齐搜索变得 vacuous;要让结论有意义就必须限制 featurizer 容量,但”在哪里划线”缺乏原则性依据。DAS 正卡在这条线上——正交旋转是线性端点,而随机网络控制已经证明即便是线性旋转、容量一大就出 false positive。这把 DAS(乃至整个 alignment-search 范式)“验证了因果抽象”的 claim 推回到”在某个被人为选定的 featurizer 容量下验证”,削弱了其作为 faithfulness 证据的力度。
  3. confirmatory,不 discover:DAS 必须先写死一个高层因果模型再去验证。错的假设 → 验证不出来,但它不会告诉你正确的高层模型是什么。Hierarchical equality 里的三个对照高层模型仍是人手设计的有限假设空间。
  4. 线性表征假设被 baked in:用正交旋转 = 假设可解释变量是激活空间的线性(旋转)子空间。论文虽称 DII 对任意可逆可微 良定义,但实现与全部实验都用旋转;非线性可分的特征 DAS 抓不到(也正是 dilemma 的来源)。
  5. 任务玩具化:hierarchical equality 与 MoNLI 都是能手工训到 100% behavioral 的小网络/微调任务,离 frontier LLM 的真实计算很远。本文没有证明可 scale——那是 Boundless DAS 等后续工作的事。
  6. 软干预 vs 模型真实使用:DII 在旋转子空间上软改机制,IIA 高只能说”在这个被学出来的对齐+干预下行为一致”,不直接等于”模型在标准前向里真的把这个变量当因果中介使用”。测的是模型还是干预,存在含混。

可信评估

Artifact 可获取性

  • 代码: inference+training(对齐学习)。原始实验仓 atticusg/InterchangeInterventions(zen 分支),并在官方 pyvene 库提供了 hierarchical equality 的复现 tutorial(DAS_Main_Introduction.ipynb)。
  • 模型权重: 未说明(被分析的网络是自训的 toy/微调模型,非发布 checkpoint)。
  • 训练细节: 正文给出网络结构、IIA 定义、超参网格(|N|、k、layer),完整细节在 Appendix A(Reproducibility);属”超参 + 设置较完整”。
  • 数据集: hierarchical equality 为合成随机向量;MoNLI 为已有公开 NLI 派生数据(Geiger et al. 2020)。

Claim 可验证性

  • 可信DAS 的 IIA 超过 brute-force/localist:Table 1 直接给出(1.00 vs 0.60 vs 0.73),有 baseline 对照、三 seed。
  • 可信左相等关系不可分解为输入身份:‘Identity Subspace’ ≈ chance(~0.51)支撑。
  • 存疑“网络真正实现了符号、树状算法”(100% IIA ⟹ perfect abstraction):成立性依赖于”旋转子空间是合法 mediator”这一前提;随机网络控制 + Non-Linear Representation Dilemma 表明高 IIA 在高容量下可能是搜索容量的产物,因果归因要打折。
  • 存疑MoNLI 的”蕴含变量”:作者自己指出其实是 word-identity 的数据结构,提醒 100% IIA 不等于语义正确的抽象。
  • 存疑可推广到真实大模型:本文未验证,仅 toy 任务;属合理但未在本文 grounding 的期望。

Notes

  • 对我们的 survey:DAS 是”因果抽象/对齐验证”这条线从手工/暴力 localist可微监督 distributed search 的转折点,是 causal mediation 的旗舰监督搜索版本,上承 patching、下启 Boundless DAS / pyvene / RAVEL。
  • 把它和无监督的 SAE 并置最有信息量:两者都赌 线性表征,但一个自上而下验证假设变量、一个自下而上发现特征字典;DAS 的 Non-Linear Representation Dilemma 与 SAE 的 feature-splitting/容量问题其实是同一枚硬币的两面——“特征/变量”的存在性都依赖于一个被人为选定的容量预算
  • ❓ 后续值得追:在限制 容量(如正交、低维子空间)+ 报告随机网络 null baseline 的前提下,IIA 的”净因果信号”该如何定义?这可能是把 alignment-search 从”可质疑”拉回”可信”的关键。

Rating

Metrics (as of 2026-06-27): citation=N/A (S2 IP throttled), influential=N/A, velocity=N/A; HF upvotes=1; github (stanfordnlp/pyvene, 官方工具库非 DAS 专属) 888⭐ / forks=108 / 90d commits=0 / pushed 113d ago

分数:3 - Foundation 理由:DAS 是”用监督式可微搜索验证因果抽象/对齐”这条可解释性子线的奠基原型——它一举破掉旧方法的暴力搜索与 localist 两大限制,确立了”学一个旋转把高层因果变量对齐到非轴对齐子空间、再用 interchange intervention 验证”的范式,并直接催生 Boundless DAS、pyvene(官方库已 888⭐)、RAVEL 等一系列后续,是理解这条线脉络的必读。S2 今日 IP throttled 无法取确切引用数,但其 family-origin 地位与被广泛继承(followed-by-many)足以支撑 Foundation,而非 Frontier(它不是一篇当下 SOTA,而是一个被反复继承与质疑的起点)。给 3 而非 2,正因为即便 2025 Non-Linear Representation Dilemma 对其根基提出根本质疑,那场质疑本身也是围绕 DAS 展开的——这恰恰印证它是这条线绕不开的 anchor。