Summary
Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations (DAS)
- 核心: 把”高层因果变量对齐到神经网络哪一块表征”这件事,从离散暴力搜索 + 假定 basis-aligned(一个变量对应一组互斥神经元)的两难里解放出来——用梯度下降学一个正交旋转 R,把高层变量对齐到旋转后子空间(一个非 basis-aligned 的分布式 mediator),再用 interchange intervention 在该子空间上验证因果抽象关系。
- 方法: distributed interchange intervention(DII,软干预:旋转→在正交子空间上 patch→旋转回去)+ 以 interchange intervention accuracy(IIA)为可微目标,冻结高/低层模型只学 R。
- 结果: 在 hierarchical equality 与 MoNLI 两个 toy 任务上找到 brute-force / localist 都找不到的 100% IIA 对齐;并用 subspace-DAS 区分”真·抽象关系”与”伪装成关系的数据结构”。
- Sources: paper | github
- Rating: 3 - Foundation(监督式因果抽象/对齐验证这条线的旗舰原型,催生 Boundless DAS、pyvene、RAVEL 等一系列后续;但 2025 Non-Linear Representation Dilemma 对其根基提出质疑)
Key Takeaways:
- 两个旧限制 → 两个新解法:旧 causal abstraction 方法 (1) 要在对齐空间里暴力搜索、(2) 假定高层变量对齐到互斥的一组神经元(localist)。DAS 分别用 gradient descent over rotations 和 distributed(重叠、非轴对齐)子空间破掉它们。
- 关键 insight 来自线性代数:在一个把输入旋转 20° 的线性网络里,“标准基下找不到对齐”是 basis 选错导致的伪结论——把隐表征反旋转 20° 就出现完美对齐。神经元与概念是 many-to-many,换个基就能露出可解释维度(Smolensky 1986)。
- IIA 是可微的、graded 的验证指标:interchange intervention accuracy = 高/低层 interchange 效果一致的比例,被 [Geiger et al. 2023] 在 approximate causal abstraction 理论里 grounding;DAS 直接把它当 loss 优化 R。
- 诚实的反面控制:在随机初始化的网络上,只要隐层维度远大于输入维度,DAS 也能把 IIA 推到 0.64——说明方法有足够容量”找出”并不被模型功能性使用的结构。这正是 2025 Non-Linear Representation Dilemma 质疑的种子。
DAS(distributed alignment search)属于机制可解释性中”因果抽象/对齐验证”这条线:它不像 Logit Lens 那样读表征、也不像 SAE 那样无监督拆特征,而是先假设一个高层符号算法(causal model),再用因果干预去验证神经网络是否实现了它。本文是这条线把”对齐搜索”从手工/暴力升级为可微监督搜索的原型工作。
问题设定:causal abstraction 与它的两个瓶颈
Causal abstraction 框架问的是:一个复杂低层因果系统(神经网络 )是否”实现”了一个简单高层因果系统(符号算法 )?判定的基本操作是 interchange intervention(即 activation patching):给网络一个 base 输入,把某组神经元强制设成它们在处理另一个 source 输入时会取的值,看输出的反事实行为是否与高层模型一致。
形式化的判定是 constructive causal abstraction:在给定对齐 下,对所有输入 与干预 ,
其中 把低层值映射到高层值。实践中很难完美成立,于是用 interchange intervention accuracy (IIA)——干预效果一致的比例——作为 graded 版本,并被 approximate causal abstraction 理论支撑。
旧方法的两个痛点(本文要解决的 delta):
- 对齐靠暴力搜索:要在”高层变量 ↔ 哪些低层神经元”的离散空间里 brute-force,组合爆炸,不可行时只能放弃,可能直接错过最优对齐。
- localist 假设:假定每个高层变量对齐到一组互斥(disjoint)的标准基神经元。但分布式表征里神经元是 many-to-many 的(superposition / polysemanticity),没有先验理由认为概念恰好沿坐标轴排列。
核心 insight:换个基,伪结论就消失
论文用一个 boolean conjunction 的线性玩具网络说明:权重把二维输入旋转 。在标准基下,把高层变量 对齐到隐单元 做 interchange intervention,反事实行为不一致——看起来”网络没实现这个算法”。但这是 basis 选择导致的 spurious 结论:只要把隐表征旋转 得到新坐标 (旋转矩阵恰是权重的逆,线性网络无激活,旋转”撤销”了权重变换), 就分别等于第一、第二个输入参数,对齐变成完美。
这说明:可解释的结构可能存在于一个非神经元对齐的基里。localist 方法因为只在标准基里找,会系统性地漏掉它。
方法:distributed interchange intervention (DII)
把”换基 + 子空间 patch”形式化为一个软干预:先用可逆函数(本文用正交旋转) 把目标神经元 变到向量空间 , 被正交分解成 ;在旋转后空间上,base 的某些子空间维度被替换成各 source 在对应子空间的值,其余()保留 base,最后旋转回去:
符号说明: base 的 total setting; 第 个 source 输入; 投影到子空间 ; 是保留 base 的”残余”子空间。含义:这是个保留因果依赖的软干预——只在被对齐的正交子空间上替换,而非整组神经元硬 patch;当 且子空间沿坐标轴时,DII 退化为普通(localist)interchange intervention。
下图是多 source DII 的完整流程:base(红)与两个 source(绿/蓝)各自前向得到 total setting,三者隐表征都用同一个 旋转到 ;在 base 的旋转表征上,把两个子空间维度分别固定成绿、蓝 source 的值;再用 旋转回去,前向算出反事实输出。DAS 的全部学习量就是这个 。
Figure 1. 一次 generic multi-source distributed interchange intervention(绿/蓝为两个 source,红为 base,底部为反事实结果)

DAS:把对齐搜索变成梯度下降
既然干预是可微的,就能把”找最优对齐”变成”学最优旋转”。冻结高层模型 和低层网络 ,只对正交矩阵 (用 PyTorch 的可微正交参数化)做 SGD,目标是让低层 DII 的(经 push-forward 的)输出分布逼近高层 interchange 的输出分布,用交叉熵:
仍保留的离散超参是 ——干预哪层神经元、每个高层变量占多少维子空间。验证指标 IIA 则是对齐后 interchange 效果一致的比例(与上式同构,只是把 CE 换成相等判断)。
❓ 关键张力: 是被高层模型监督着学出来的——它在”发现”模型已有的结构,还是在”塑造”一个能让 IIA 变高的对齐?这正是下面随机网络控制要回答的,也是后续争议的核心。
实验一:Hierarchical Equality
任务 :判断两对物体的相等关系是否一致。训三层 ReLU 前馈网,behavioral 100%。高层假设:网络先算左相等 、右相等 两个中间变量,再合成最终标签(认知科学里默认的解法)。另设两个对照高层模型:只表示左对的相等关系、以及只编码第一个输入物体的 identity。
Table 1. Hierarchical equality 对齐结果(cell = 训练集 IIA,三 seed 取最优)
| 设置 | Both Equality (L1/L2/L3) | Left Equality (L1/L2/L3) | Identity of 1st Arg (L1/L2/L3) | Identity Subspace of Left Eq (L1) |
|---|---|---|---|---|
| |N|=16, k=1 | 0.88 / 0.51 / 0.50 | 0.85 / 0.54 / 0.50 | 0.51 / 0.52 / 0.50 | 0.51 |
| |N|=16, k=8 | 1.00 / 0.57 / 0.50 | 0.90 / 0.56 / 0.50 | 0.52 / 0.53 / 0.51 | 0.51 |
| |N|=32, k=16 | 0.99 / 0.67 / 0.53 | 0.99 / 0.65 / 0.50 | 0.49 / 0.55 / 0.52 | 0.51 |
| Brute-Force Search | 0.60 / 0.56 / 0.52 | 0.64 / 0.64 / 0.57 | 0.50 / 0.51 / 0.54 | - |
| Localist Alignment | 0.73 / 0.56 / 0.48 | 0.60 / 0.50 / 0.49 | 0.46 / 0.47 / 0.48 | - |
读法:DAS 在 ‘Both Equality Relations’ 高层模型 + 第一层 + 足够子空间维度(k=8/16)下拿到 1.00 IIA,而 brute-force 最好只有 0.60、localist 最好 0.73——分布式对齐找到了离散/轴对齐方法系统性漏掉的结构。而 ‘Identity Subspace of Left Equality’(试图把左相等子空间再拆成第一个参数的 identity)始终 ~0.51 ≈ chance:说明网络学的是真·抽象的相等关系,而不是偷偷存了输入物体的身份。
实验一·控制组:随机网络(最重要的 caveat)
在 behavioral 50%(chance)的随机初始化网络上跑 DAS:
| Hidden |N| / intervention k | IIA (Layer 1) |
|---|---|
| 16 / 8 | 0.50 |
| 64 / 32 | 0.50 |
| 256 / 128 | 0.51 |
| 1028 / 512 | 0.55 |
| 4096 / 2048 | 0.64 |
小网络里 DAS 无法提升 IIA(好消息:它不能凭空造行为);但当隐层维度比输入维度(16)大几个数量级时,IIA 升到 0.64——随机结构足够多时,DAS 能搜出一个旋转把无意义的随机机制”对齐”成可系统操纵反事实行为的样子。作者把这当作”DAS 不能从随机结构造出全新行为”的 sanity check;但反过来读,它暴露了方法的容量本身可能制造 false positive。
实验二:Monotonicity NLI (MoNLI)
微调一个预训练 Transformer 解 MoNLI(premise/hypothesis 仅差一个词,判断 entails / neutral,含否定会翻转词汇关系)。DAS 找到对”词汇蕴含关系”这个二值变量的 100% IIA 对齐。但一个诚实的发现:用 subspace-DAS 进一步拆这个”蕴含关系”子空间,发现它可被分解成 和 两个词身份的表征——也就是说,它看似是个”关系”变量,实则是个装着两个词身份的数据结构(data structure),而非真正编码了二者的蕴含关系。对比之下 hierarchical equality 的相等关系不可分解,是真正从参与实体中抽象出来的。这个对比是本文方法论上最有价值的副产品:高 IIA 不等于”找到了一个语义上正确的抽象变量”,还要追问它能否被进一步分解。
关联工作
基于
- Causal abstraction 理论 + IIA(Geiger et al. 2021/2023): DAS 直接建立在”interchange intervention 效果一致 ⟺ 因果抽象成立”的判定与 approximate causal abstraction(α-on-average)的 graded 理论上。见 因果中介分析。
- Interchange intervention = activation patching: DII 是 patching 的软化/换基推广; 时退化为标准 patching。
- Interchange Intervention Training (IIT)(Geiger et al. 2022b; Wu et al. 2022): 用同类目标训模型去实现某高层模型;DAS 复用 IIT 目标,但冻结模型只学对齐。
- 分布式表征思想(Smolensky 1986; Rumelhart/McClelland 1986): many-to-many、换基露结构的直接理论来源,关联 superposition / polysemanticity。
对比
- Brute-force / localist 对齐(本文的 baseline): DAS 在 IIA 上显著超过二者,证明分布式、可微搜索的价值。
- ROME: 同样用 causal mediation 定位+干预,但 ROME 在标准基/具体权重上做编辑、面向事实知识;DAS 在学到的旋转子空间上做软干预、面向算法变量的验证。
- ACDC / IOI circuit: 电路发现路线在标准基下找子图/边;DAS 不找电路而是验证一个预设的高层因果变量是否被某子空间实现——是 confirmatory 而非 exploratory。
- SAE / dictionary learning: 无监督、自下而上拆特征字典;DAS 有监督、自上而下验证假设变量。两者对”特征是否线性子空间”做了同样的赌注(linear representation hypothesis)。
方法相关
- 后续谱系:Boundless DAS(把 的维度也学出来,scale 到 Alpaca/LLaMA 级)、pyvene(统一干预库,本文 github)、RAVEL(属性解耦评测)都源自这条线。
- faithfulness:IIA 本质是一种 causal/counterfactual faithfulness 度量。
论文点评
Strengths
- 把不可行的离散搜索变成可微优化:brute-force 对齐随网络规模组合爆炸,DAS 用正交旋转的可微参数化 + SGD 直接学对齐,是工程上的关键解锁,也是后续能 scale 到真实 LLM 的前提。
- 非 basis-aligned mediator:明确放弃”概念沿坐标轴”的 localist 假设,允许重叠子空间——这与 superposition/distributed representation 的经验事实一致,且 boolean conjunction 的 20° 例子把”为什么标准基会给出伪负结论”讲得极清楚。
- graded、有理论支撑的验证指标:IIA 不是 ad-hoc,而是 approximate causal abstraction 的实例化。
- subspace-DAS 的可证伪精神:主动去拆”看似关系变量”,发现 MoNLI 的蕴含其实是数据结构——把”高 IIA”和”真抽象”分开,体现了诚实的 critical reading。
- 诚实的随机网络控制:作者没有藏 0.64 这个尴尬结果,而是把它当 sanity check 报告出来。
Weaknesses
- 随机网络 0.64 是方法论根上的警报:当隐维 ≫ 输入维,DAS 能在无意义随机结构上搜出高 IIA。这说明学到的旋转有足够容量拟合高层模型,而非纯粹发现网络已有的计算。“DAS 找到对齐”与”DAS 制造了对齐”在高容量下难以区分。
- 2025 Non-Linear Representation Dilemma 的根本质疑(务必记住):如果允许 featurizer 任意强(非线性),那么几乎任何高层变量都能被”找到”编码在激活里,对齐搜索变得 vacuous;要让结论有意义就必须限制 featurizer 容量,但”在哪里划线”缺乏原则性依据。DAS 正卡在这条线上——正交旋转是线性端点,而随机网络控制已经证明即便是线性旋转、容量一大就出 false positive。这把 DAS(乃至整个 alignment-search 范式)“验证了因果抽象”的 claim 推回到”在某个被人为选定的 featurizer 容量下验证”,削弱了其作为 faithfulness 证据的力度。
- confirmatory,不 discover:DAS 必须先写死一个高层因果模型再去验证。错的假设 → 验证不出来,但它不会告诉你正确的高层模型是什么。Hierarchical equality 里的三个对照高层模型仍是人手设计的有限假设空间。
- 线性表征假设被 baked in:用正交旋转 = 假设可解释变量是激活空间的线性(旋转)子空间。论文虽称 DII 对任意可逆可微 良定义,但实现与全部实验都用旋转;非线性可分的特征 DAS 抓不到(也正是 dilemma 的来源)。
- 任务玩具化:hierarchical equality 与 MoNLI 都是能手工训到 100% behavioral 的小网络/微调任务,离 frontier LLM 的真实计算很远。本文没有证明可 scale——那是 Boundless DAS 等后续工作的事。
- 软干预 vs 模型真实使用:DII 在旋转子空间上软改机制,IIA 高只能说”在这个被学出来的对齐+干预下行为一致”,不直接等于”模型在标准前向里真的把这个变量当因果中介使用”。测的是模型还是干预,存在含混。
可信评估
Artifact 可获取性
- 代码: inference+training(对齐学习)。原始实验仓
atticusg/InterchangeInterventions(zen 分支),并在官方 pyvene 库提供了 hierarchical equality 的复现 tutorial(DAS_Main_Introduction.ipynb)。 - 模型权重: 未说明(被分析的网络是自训的 toy/微调模型,非发布 checkpoint)。
- 训练细节: 正文给出网络结构、IIA 定义、超参网格(|N|、k、layer),完整细节在 Appendix A(Reproducibility);属”超参 + 设置较完整”。
- 数据集: hierarchical equality 为合成随机向量;MoNLI 为已有公开 NLI 派生数据(Geiger et al. 2020)。
Claim 可验证性
- 可信:DAS 的 IIA 超过 brute-force/localist:Table 1 直接给出(1.00 vs 0.60 vs 0.73),有 baseline 对照、三 seed。
- 可信:左相等关系不可分解为输入身份:‘Identity Subspace’ ≈ chance(~0.51)支撑。
- 存疑:“网络真正实现了符号、树状算法”(100% IIA ⟹ perfect abstraction):成立性依赖于”旋转子空间是合法 mediator”这一前提;随机网络控制 + Non-Linear Representation Dilemma 表明高 IIA 在高容量下可能是搜索容量的产物,因果归因要打折。
- 存疑:MoNLI 的”蕴含变量”:作者自己指出其实是 word-identity 的数据结构,提醒 100% IIA 不等于语义正确的抽象。
- 存疑:可推广到真实大模型:本文未验证,仅 toy 任务;属合理但未在本文 grounding 的期望。
Notes
- 对我们的 survey:DAS 是”因果抽象/对齐验证”这条线从手工/暴力 localist → 可微监督 distributed search 的转折点,是 causal mediation 的旗舰监督搜索版本,上承 patching、下启 Boundless DAS / pyvene / RAVEL。
- 把它和无监督的 SAE 并置最有信息量:两者都赌 线性表征,但一个自上而下验证假设变量、一个自下而上发现特征字典;DAS 的 Non-Linear Representation Dilemma 与 SAE 的 feature-splitting/容量问题其实是同一枚硬币的两面——“特征/变量”的存在性都依赖于一个被人为选定的容量预算。
- ❓ 后续值得追:在限制 容量(如正交、低维子空间)+ 报告随机网络 null baseline 的前提下,IIA 的”净因果信号”该如何定义?这可能是把 alignment-search 从”可质疑”拉回”可信”的关键。
Rating
Metrics (as of 2026-06-27): citation=N/A (S2 IP throttled), influential=N/A, velocity=N/A; HF upvotes=1; github (stanfordnlp/pyvene, 官方工具库非 DAS 专属) 888⭐ / forks=108 / 90d commits=0 / pushed 113d ago
分数:3 - Foundation 理由:DAS 是”用监督式可微搜索验证因果抽象/对齐”这条可解释性子线的奠基原型——它一举破掉旧方法的暴力搜索与 localist 两大限制,确立了”学一个旋转把高层因果变量对齐到非轴对齐子空间、再用 interchange intervention 验证”的范式,并直接催生 Boundless DAS、pyvene(官方库已 888⭐)、RAVEL 等一系列后续,是理解这条线脉络的必读。S2 今日 IP throttled 无法取确切引用数,但其 family-origin 地位与被广泛继承(followed-by-many)足以支撑 Foundation,而非 Frontier(它不是一篇当下 SOTA,而是一个被反复继承与质疑的起点)。给 3 而非 2,正因为即便 2025 Non-Linear Representation Dilemma 对其根基提出根本质疑,那场质疑本身也是围绕 DAS 展开的——这恰恰印证它是这条线绕不开的 anchor。