Summary

CircuitLasso:用稀疏回归做可扩展的 LLM 电路发现

  • 核心: 把 circuit discovery 从昂贵的 intervention(反复 forward/backward)重新表述为一个 observational 的 sparse linear regression(Lasso) 问题,从而能 scale 到 SAE 的高维 feature 空间。
  • 方法: 把 LLM 各组件激活拼成向量,用 block upper-triangular(按层计算顺序天然无环)的 Lasso 拟合 ,学出组件间的稀疏依赖 skeleton;可作用于 neurons,也可作用于 SAE features。
  • 结果: 在 InterpBench 上与 SOTA intervention 方法(EAP / EAP-ig)精度持平、速度快 2-3×;在 SAE feature 上得到可读的 tree-shaped circuit;在 Bias-in-Bios debiasing 上以更低成本达到可比效果。
  • Sources: paper
  • Rating: 1 - Archived(不在 Owner 主脉络的 workshop paper;方法巧但用线性 surrogate 换 scalability,可信度被自己 disclaim,影响力待观察)

Key Takeaways:

  1. 范式替换:现有 circuit discovery 靠 causal intervention(activation/attribution patching),逐边估计因果效应,成本随模型尺寸和组件数爆炸;本文换成纯观测数据上的回归,绕开 intervention。
  2. 无环约束的”白嫖”:因果发现里最难的 acyclicity constraint,在 transformer 里被前馈计算顺序天然满足——直接把邻接矩阵约束成 block upper-triangular 即可,无需 NOTEARS 式的连续松弛。
  3. 代价是降级目标:作者明确不声称恢复 per-edge 因果效应,只恢复 dependency skeleton(谁影响谁); 是”线性化误差”而非外生噪声,identifiability 定理一律不援引。

Teaser. Figure 1:整体流程——采集 neuron 激活 / SAE feature,学出 circuit,再用于下游任务。


前置概念

为你(熟悉 SAE,但没看过 circuit-level interp)补一层背景。已经清楚的部分可跳过。

Mechanistic Interpretability(MI)的目标:不是”模型对这个输入预测了什么”,而是”模型通过什么内部计算机制得到这个预测”。它把一个训练好的网络当作待逆向工程的程序。

什么是 Circuit:MI 里的 circuit 指模型计算图里一个紧凑子图——一小撮组件(attention head、MLP neuron、或 SAE feature)外加它们之间的连边,共同负责某个具体行为。经典案例如 induction heads(负责 in-context learning 的复制行为)、IOI(Indirect Object Identification,“John gave a drink to ___” 该填 Mary 的回路)。Circuit-level interp 比单个 neuron/feature 的解释更进一步:它关心信息如何在组件之间流动、聚合、演化

Circuit discovery 怎么做(本文要替换的对象):主流是 intervention-based,核心工具是 patching

  • Activation patching / causal tracing:跑两个输入(clean 和 corrupted),把某个组件的激活从一个 run “移植”到另一个 run,看输出变化多少 → 量化该组件的因果重要性。
  • Attribution patching(AP / EAP):上面的方法每条边都要单独干预一次,对大模型不可行;AP 用一阶泰勒(梯度)一次性近似所有边的效应,EAP(Edge Attribution Patching)、EAP-ig(加 integrated gradients 提升 faithfulness)是当前 SOTA。即便如此,每个观测仍需 2 forward + 1 backward pass。

为什么 SAE 让问题更难:你已经知道 SAE 把 polysemantic 的 raw neuron 激活 重写成高维稀疏、单义(monosemantic)的 feature )。SAE feature 更适合做可读 circuit 的节点(每个节点有人类可懂的语义标签)。 通常是 的几十倍,intervention-based 方法逐 feature/逐边干预的成本直接爆炸——这正是 CircuitLasso 要解决的 scalability 痛点。

❓ 一个值得记住的张力:SAE 让”节点可读”,但也让”边的数量”暴涨。本文的赌注是——既然 intervention 在这个维度下不可行,不如退一步,用便宜的观测回归只求 skeleton。

Lasso 回归(复习):本文唯一用到的机器学习工具,30 秒回忆一下:

  • 普通最小二乘(OLS)拟合 ,最小化 ,解出的 通常每个分量都非零(dense)。
  • Lasso = OLS 加一个 惩罚:,其中
  • 惩罚的几何性质会把很多系数精确压成 0(不是压小,是压没),于是自动做了 变量选择——只留下少数真正有用的预测变量。 越大,留下的非零系数越少。
  • 为什么这里用它:把”哪些更早的组件是组件 的父节点”看成一个回归问题,我们要的恰恰是少数几条边(稀疏 circuit)。系数 $A[i,j]\neq 0$存在边 $i\to j$ 帮你自动筛掉弱依赖,留下的非零系数就是 circuit 的边。且这个目标是凸的,用 FISTA(加速近端梯度)求解很便宜——这是它能 scale 的另一半原因。

核心思想:把 circuit discovery 变成 sparse linear regression

作者的关键观察:intervention-based circuit discovery 与 constraint-based 因果发现(用独立性检验筛边,如 PC 算法)同构——都得逐边评估依赖、都因此 scale 不动。那不如借用因果发现的另一条线:continuous / score-based structure learning(NOTEARS 那一脉),把找图变成一个连续优化。

把从 LLM 指定位置抽取的 个组件激活拼成向量 ,目标是学一个以这些组件为节点的 DAG。假设组件间为线性 structural equation model(SEM),写成矩阵形式:

Equation 1. 线性 SEM surrogate

符号说明 个观测下 个组件的激活; 是加权邻接矩阵, 表示有向依赖 线性化误差(注意:不是外生噪声,LLM 激活是确定性的)。

学习目标 = 重构误差 + 稀疏惩罚 + 无环约束:

Equation 2. 带稀疏 + 无环约束的目标

含义 稀疏惩罚(即 Lasso),把弱依赖滤掉,得到稀疏、可读的图; 是无环图空间。

❗ 作者在 “Discussion of Assumptions” 里非常诚实地把 surrogate 性质讲清楚了:因果充分性、独立噪声、线性函数形式在 transformer 里(residual stream、SAE 重构误差、attention/LayerNorm/MLP 的非线性)都只近似成立。所以他们不援引任何 identifiability 定理,只声称恢复 dependency skeleton(最强依赖的保守地图)。这是本文最该被记住的 caveat,也是它的诚实之处。

无环约束怎么免费拿到

连续因果发现里 acyclicity 是最贵的部分(NOTEARS 用矩阵指数迹做软约束)。本文指出:transformer 的前馈计算顺序本身就给了一个合理的拓扑序——layer 的激活在 layer )之前算出、且被后者依赖;同层内 attention 在 MLP 之前。于是把组件按计算顺序 reorder,邻接矩阵直接约束成 block upper-triangular

Equation 3. neuron 上的 block 上三角 Lasso

每个 block ,当 时强制为零矩阵(实现上初始化为零并固定不更新)。这保证”后层不能影响前层”,从而无需显式无环约束,问题退化成纯 Lasso,可被 FISTA 高效求解( 迭代复杂度)。

这一步是整个方法 scalable 的关键:把”找 DAG”这个 NP-hard 问题,靠领域结构(前馈序)降成了凸的稀疏回归。代价是承诺了拓扑序与计算序对齐——后面会看到这会引入 anti-causal 的边。

复杂度优势

作者给了两个 proposition。CircuitLasso 在 neurons 上的总成本 不跑任何 backward pass,只共享一次用于采集激活的 forward。相比之下 EAP-ig 每个观测要 2 forward + 1 backward 过整个 LLM。Proposition 3.2 给出了 CircuitLasso 保证更快的具体条件(取决于序列长度 、组件位置数 、维度 等的关系)。

作用到 SAE features

把上述框架从 neuron 搬到 SAE feature:对计算序上 先于 的两个位置,先用预训练 SAE 编码得到 feature ,再对每一对 解一个 Lasso:

Equation 4. SAE feature 间的 layer-wise 回归

成本 。此外还可把下游预测目标 纳入,学一个从 feature 直接到预测的稀疏系数 (Eq. 5,成本 ),用于解释和纠正模型的预测行为——这正是后面 debiasing 实验的抓手。


操作化:它到底在跑什么(含伪代码)

论文的公式偏抽象,这里把”实际拿到一个模型后逐步在干什么”摊开。作者未开源,以下伪代码是我按论文 Eq.1–5 + 复杂度证明重建的操作语义,非官方实现,细节( 选择、阈值)以论文附录为准。

A. Neuron 版(对应 InterpBench 实验)

直觉一句话:一次 forward 把所有组件的激活录下来,然后纯在这些数字上做一堆”后层激活 = 前层激活的稀疏线性组合”的 Lasso 回归,回归系数非零的地方就是边。 全程不再碰模型、不跑 backward。

  1. 选组件位置:挑 个你关心的位置(如每层的 attention 输出、MLP 输出),每个宽度
  2. 采集激活(唯一一次 forward):拿 个 prompt 喂模型,把这 个位置的激活录下来 → 。这是和 EAP 唯一共享的开销。
  3. 按计算序排好:把 reshape 成 ),行的顺序 = 计算顺序(早算的组件排前面)。
  4. 建带约束的邻接矩阵 ,切成 的 block。强制所有”下三角”block()= 0 且不参与优化——这就是”后层不能当前层父节点”的无环约束,免费来自前馈序。
  5. 解 Lasso(FISTA):最小化 。因为约束是 block 上三角,这自动拆成 个互相独立的子问题:对每个目标 block ,用它前面所有 block 的激活去回归它自己的 维激活。
  6. 读出 circuit ⟹ 画一条边 。和 ground-truth 比 SHD。
# CircuitLasso — neuron 版(重建的伪代码,非官方)
Input: model, prompts[1..M], locations[1..L] (按计算序), dim d, λ
# 1) 采集激活:唯一一次 forward
H = zeros(L, d, M)
for m in 1..M:
    acts = model.forward(prompts[m], cache=locations)   # 不需要 backward
    for l in 1..L: H[l, :, m] = acts[locations[l]]
X = reshape(H, (L*d, M))                                 # = X̃,行按计算序
 
# 2) 逐目标 block 独立解 Lasso(block 上三角 ⇒ L 个子问题)
A = zeros(L*d, L*d)
for l in 2..L:                                           # l=1 无父节点,跳过
    Y      = X[block(l), :]                              # 目标:第 l 块的 d 维激活, shape (d, M)
    Xprev  = X[blocks(1..l-1), :]                        # 预测变量:所有更早的块, shape ((l-1)d, M)
    # 多输出 Lasso:min_W ||Yᵀ - Xprevᵀ W||² + λ||W||₁,FISTA 求解
    W = fista_lasso(Xprev.T, Y.T, λ)                     # W shape ((l-1)d, d)
    A[blocks(1..l-1), block(l)] = W                      # 只填上三角,下三角恒 0
 
# 3) 读边
edges = { (i, j) for all i,j if abs(A[i, j]) > 0 }
return edges

B. SAE feature 版(对应可读 circuit + debiasing)

唯一区别:节点从 raw neuron 换成 SAE feature,且逐 layer-pair 解回归(feature 维 很大,按相邻/有序层对拆开更省)。

  1. 采集激活后,对每个位置 预训练 SAE 编码:
  2. 对每个有序对 先于 )解 Eq.4: → 得到 feature 间的边。
  3. 要解释预测:再对标签 解 Eq.5,,按 给末层 feature 排序。
  4. 画 tree-shaped circuit:从末层 top feature 出发,沿 反向回溯,每层挑系数最大的父 feature,递归成树(Figure 3 就是这么来的)。
  5. debiasing(Bias-in-Bios):按 排序 → 人工挑出 gender 相关 feature → 把它们的激活置零 → 喂回(或重训)分类器。
# CircuitLasso — SAE feature circuit + 反向回溯(重建的伪代码,非官方)
Z = { i: SAE_encode(H[i], sae[i]) for i in locations }   # 每个 z_i shape (D, M)
 
# 相邻层对的 feature→feature 边
for (i, j) in ordered_layer_pairs:                       # i 先于 j
    A[i,j] = fista_lasso(Z[i].T, Z[j].T, λ)              # (D, D),大多数项被压成 0
 
# feature→预测 的系数(用于排序与解释)
A_pred[L] = fista_lasso(Z[L].T, y, λ)                    # (D,) 或 (D, n_class)
 
# 从末层 top feature 反向回溯成树
roots = top_k_features_by(abs(A_pred[L]))
def trace_back(feat, layer):
    if layer == first_layer: return leaf(feat)
    parents = top_features_by(abs(A[layer-1, layer][:, feat]))  # 谁强烈馈入 feat
    return node(feat, [trace_back(p, layer-1) for p in parents])
circuit = [trace_back(r, L) for r in roots]

这两段伪代码合起来就是全部”魔法”:没有反事实干预、没有梯度归因,只是把激活当数据矩阵反复做稀疏回归。 这也是为什么它便宜——以及为什么它只能给依赖 skeleton(回归系数 ≠ 因果效应,方向是你用 block 上三角硬塞进去的)。


实验

1. Neuron 电路:精度持平、速度更快(InterpBench)

在 InterpBench(86 个有 ground-truth circuit 的半合成 transformer)的 16 个合成 case + 真实 IOI 上,对比 EAP / EAP-ig,用 SHD(Structural Hamming Distance,越低越好)和 wall-clock 衡量。

Figure 2. InterpBench 上的精度(左,SHD)与效率(右,runtime)。

  • CircuitLasso-linear:平均 SHD 3.16,与 EAP-ig(2.98)统计上无差异、优于 EAP(3.61);平均 16.3s/case,比 EAP-ig(49.1s)快 3.0×、比 EAP(33.7s)快 2.1×。→ 支撑”efficiency at parity of accuracy”主张。
  • CircuitLasso-nonlinear:SHD 最低(2.84)但仅微弱领先,runtime 却 3.7×,得不偿失——说明依赖结构已被线性边重要性捕捉得差不多了。

2. SAE feature 电路:可读的 tree-shaped circuit(CoLA + GPT-2 small)

用 OpenAI 为 GPT-2 small 预训练的 SAE,在 CoLA(语言可接受性判断,10657 句,作者称是 MI 里首次使用的数据集)上学 SAE-feature circuit。从预测层 4 个可读 feature 出发,沿 反向回溯父节点,得到跨层的树状回路:

Figure 3. GPT-2 small 上学到的 SAE feature 电路(不同颜色 = 不同类型的边)。

作者从中观察到几类语义传播模式:

  • Persistence:某些概念(如 “-self”)沿回路在多个连续层持续存在。
  • Merging / Dropping:后层 feature 可合并多个父 feature 的概念,或丢弃其中某些(如 layer 11 的某 feature 只保留 “himself” 而丢掉其它 “-self” 形式)。
  • Cause-Effect & Spurious:能捕捉因果语义(“hunger/thirst” → “ate/eat”);但也暴露方法的硬伤——因为强制拓扑序 = 计算序,部分边会显得 anti-causal(“eat” 出现在 “hunger” 之前层);同时会捕到 spurious correlation(“-self” 与 “hunger/thirst” 因训练数据共现而被连边)。作者把后者反过来当卖点:可借此诊断数据集 bias 并做 targeted editing

❓ 这是 skeleton-only 目标的直接后果:方向完全由计算序决定,而非数据中的因果信号,所以”anti-causal 边”不是 bug 而是设计上必然。读者需要清楚——这些回路是依赖图,不能当因果图读。

faithfulness / completeness(沿用 Marks et al. 2025 的指标)上,CircuitLasso 的回路在 node ablation 下与 intervention-based 的 SHIFT 持平,且因为有显式边系数,额外支持 edge ablation(SHIFT 做不到)。

Figure 4. CoLA 上回路的 faithfulness / completeness(上:node ablation,下:edge ablation)。理想 faithfulness=1,completeness=0。

3. 效用演示:Bias-in-Bios debiasing

作者把这一节定位为”insight 的 utility demonstration”,明确作为 circuit learning 的贡献,且任何精度优势只归因于操作 disentangled SAE feature 的副产品。任务:从传记预测职业,训练集存在 gender-spurious 关联,测试集 balanced。方法:按 排序 feature,手动找出 gender 相关 feature,置零后喂回分类器。

Table 1. SHIFT vs CircuitLasso 的运行时与选中 feature 数(不含人工解释时间)。

MethodPythia-70M #featPythia-70M Runtime(s)Gemma-2-2b #featGemma-2-2b Runtime(s)Gemma-2-9b #featGemma-2-9b Runtime(s)
SHIFT49257.665371.271908.4
SHIFT-retrain49356.365476.8711056.0
CircuitLasso4136.55547.259107.4
CircuitLasso-retrain4161.95572.559125.2

效率优势随模型增大而拉大(9B 上 107s vs 908s)。精度(Table 2,profession accuracy / gender leakage 接近 50% 为佳 / worst-group)上 CircuitLasso-retrain 与最强非 oracle baseline 持平或略好。


关联工作

基于

  • Sparse Autoencoders(Bricken et al. 2023; Cunningham et al. 2023; Gemma Scope; OpenAI SAE for GPT-2):提供单义 feature 作为可读 circuit 的节点,是本文 SAE 实验的基础设施(直接用预训练 SAE,不训新的)。
  • NOTEARS / continuous structure learning(Zheng et al. 2018):把”找 DAG”变连续优化的思想来源;本文是它在 LLM circuit 上的 surrogate 应用,但靠前馈序绕开了 acyclicity 的软约束。
  • FISTA(Beck & Teboulle 2009):求解 composite(光滑二次 + )目标的加速近端梯度,给出复杂度保证。

对比

  • EAP / EAP-ig(Syed et al. 2024; Hanna et al. 2024):当前 SOTA intervention-based circuit discovery,本文 neuron 实验的主对手,主张同精度更快。
  • SHIFT / Sparse Feature Circuits(Marks et al. 2025):在 SAE feature 上做 circuit + debiasing 的代表工作,本文 SAE 实验与 Bias-in-Bios 直接对标,并沿用其 faithfulness/completeness 指标和 SAE。
  • ACDC(Conmy et al. 2023):迭代剪边的自动 circuit discovery,类比 PC 算法;本文指出其同样有 scalability 瓶颈。

方法相关

  • Per-prompt attribution graphs(Ameisen et al. 2025 “Circuit tracing”; Lindsey et al. 2025 “On the biology of an LLM”,均 Anthropic Transformer Circuits):在 transcoder feature 上构建单 prompt 归因图。作者定位 CircuitLasso 与之互补——前者回答 per-instance 机制,CircuitLasso 聚合多 prompt 给 population-level skeleton,适合 dataset 级解释 / editing / domain generalization。
  • RelP(Jafari et al. 2025):用 LRP 系数替代局部梯度提升 AP 的 faithfulness,但继承 EAP 的 runtime,故本文未单独对比。

论文点评

Strengths

  1. 问题重述漂亮:把 intervention-based circuit discovery 与 constraint-based causal discovery 的同构点出来,进而借 score-based 那一脉换成观测回归,是个 clean 的 reframing。“用前馈计算序免费拿 acyclicity”尤其优雅——这是真正利用了领域结构。
  2. (最终版的)诚实:arXiv 版 Discussion of Assumptions 明确放弃 identifiability、把 限定为线性化误差、只声称恢复 skeleton;nonlinear 变体”diminishing returns”也如实报告;DG 一节主动声明不算贡献。注意:但需注意:这份自我设限是被 ICLR 审稿逼出来的事后退守——投稿版本里作者其实在力保因果性(见下「评审历史」)。所以”诚实”该记给最终版,不该记给原始 claim。
  3. 效率优势 grounded:不只有经验数字,还有复杂度 proposition 给出何时保证更快的条件。

Weaknesses

  1. 核心代价被价值打了折:方法的卖点是 scalability,但换来的产物是 dependency skeleton,不是因果图。边的方向完全由计算序决定,导致 anti-causal 边必然出现——而 circuit 的全部意义恰恰在于理解因果机制。这是”用可信度换 scalability”,对真正的 mechanistic 主张是减法。
  2. 线性假设的根基薄弱:transformer 高度非线性,作者自己承认假设只近似成立;而 nonlinear 变体几乎无增益又更慢,等于变相说明这个 surrogate 的天花板就在这。skeleton 的”忠实性”缺乏 ground-truth 校验(InterpBench 只验了 neuron-level 拓扑,SAE feature 回路的语义解释靠人工标注 + faithfulness 代理指标)。
  3. 可读 circuit 的解释强度有限:Figure 3 的 tree 是”choose for human-interpretable illustration”的 representative traversal,无固定 cap / 阈值——即解释带挑选成分,离 SHIFT/attribution graph 那种系统性还有距离。
  4. 新意更多在”组合”:NOTEARS + Lasso + SAE + 前馈序约束都是已有积木,贡献在拼装与 reframing,方法本身的 depth 一般。Workshop paper 的体量也与此相称。
  5. 强依赖预训练 SAE(reviewer gmiW + AC 核心拒因):方法整条 SAE pipeline 建立在”有现成、低重构误差、真单义的 SAE”之上;对没有 SAE 资源的模型不可用,且论文未量化 SAE fidelity 如何影响 circuit 准确性。重要 feature 靠 coefficient magnitude / Hadamard 选,在 feature collinearity 下可能不稳定。
  6. 缺 positional / token awareness(reviewer mu8u):对各 position 的表征做平均换 scalability,丢掉了输入不同部分之间的因果结构,使其与”position-aware 的 neuron 依赖图”类方法难以公平对比。此外,原始投稿只用了 5 个随机抽的 InterpBench case,rebuttal 阶段才扩到 16 个——初版实证面偏窄。

评审历史:ICLR 2026 投稿被拒(Submission #9942)

这篇先投 ICLR 2026(2025-09-18 提交),被拒(2026-01-26 Decision: Reject),修改后才进 ICML 2026 MI Workshop / 挂 arXiv。我读的 arXiv v1 即已吸收 rebuttal 增补(扩到 16 case、加 faithfulness/completeness 的 edge ablation、补 nonlinear 变体)的版本。

ReviewerRatingSoundnessConfidence
mu8u6(marg. above)3 good3
gmiW4(marg. below)3 good4
jgHf4(marg. below)2 fair2
mt7L2(reject)2 fair4

AC(5M96)meta-review 两条核心拒因

  1. 因果 claim 不严谨:观测数据 + 线性假设,缺乏足够的定量 interventional 实验把因果与相关分开;作者的 single/multi-prompt 验证不足以做 definitive causal validation。
  2. 依赖预训练 SAE:对没有现成 SAE 的模型不可用,泛化性受限。

关键的 claim 演化(最值得记的一点):ICLR rebuttal 里作者力保因果性——援引 Peters et al. (2014) 的 identifiability,声称假设 causal sufficiency + 特定噪声(non-Gaussian / equal-variance Gaussian)就能让学到的 DAG “uniquely identifiable and thus interpretable as the underlying causal structure”。reviewer(mt7L、gmiW、jgHf)一致指出这些假设在 transformer 里既不成立也未验证。到了 arXiv/workshop 版,作者主动退守为”we do not appeal to identifiability theorems… recover the dependency skeleton”。即:被审稿压力逼着把 claim 从”因果结构”降级为”依赖 skeleton”——本笔记上文”这是依赖图不是因果图”的批判,正是 reviewer 共识,且作者最终自己也认了。

对 Owner 的元启发:这是一个”investigate 高引/光鲜 framing 时,去翻 OpenReview 拒稿史能直接拿到社区 critique + 作者退守轨迹”的好例子。一篇 paper 的 arXiv 终版常常是被审稿磨过的妥协版,对照投稿版能看出哪些 claim 是真站得住、哪些是被迫收回的。

可信评估

Artifact 可获取性

  • 代码: 未开源(arXiv / OpenReview 均未给出仓库链接)
  • 模型权重: 不适用(用预训练 GPT-2 small / Pythia-70M / Gemma-2-2B/9B + 公开预训练 SAE)
  • 训练细节: 仅高层描述 + Appendix(FISTA 优化、 选择等在附录,但无代码佐证)
  • 数据集: 全部公开——InterpBench、CoLA(GLUE)、Bias-in-Bios

Claim 可验证性

  • 可信:“efficiency at parity of accuracy”:InterpBench 上 SHD 与 runtime 数字明确,有复杂度证明支撑,可信。
  • 可信:“scale 到 SAE 高维 feature”:在 Gemma-2-9B 上完成、runtime 对比 SHIFT 清晰,确实跑通了。
  • 存疑:“学到的回路反映模型内部机制”:方向由计算序强加、只保 skeleton,回路是依赖图而非因果图;语义解释含人工挑选成分——作为”机制理解”应打折。
  • 存疑:“CoLA 首次用于 MI”:领域 first 类 claim,难严格核验,但无关方法成立性。
  • 存疑:DG 上的精度优势:作者自己归因为操作 disentangled feature 的副产品而非 circuit learning,故不应作为方法有效性的强证据。

Notes

  • 对 Owner:这篇适合作为理解 circuit-level interp 是什么 / intervention vs observational 两条路线的入门读物,而非方法本身要追的工作。真正想深入 circuit,应去读 EAP-ig、Marks et al. 2025(SHIFT)、以及 Anthropic 的 attribution graph 两篇(per-prompt 路线,机制解释更强)。
  • 一个可迁移的 takeaway:“用领域已知结构把难约束变免费”(这里是前馈序 → acyclicity)是个通用招式,在持续学习 / agent 的结构学习里也许能借鉴。
  • 与 Owner 方向(CL / agent / LLM RL)无直接交集;归档备查。

Rating

Metrics (as of 2026-06-27): citation=0, influential=0 (N/A%), velocity=0.0/mo(发布仅 ~12 天); HF upvotes=N/A(论文未被任何 HF repo 引用,无页面); github=N/A(未开源)

分数:1 - Archived 理由ICLR 2026 投稿被拒、落到 MI workshop 的 paper,方法是 NOTEARS+Lasso+SAE+前馈序约束的巧妙组合,reframing 干净,但核心是用线性 surrogate 的可信度(只得 skeleton、方向靠计算序强加)换 scalability,对真正的 mechanistic 主张是减法——而这恰是 ICLR reviewer + AC 的核心拒因(因果 claim 不严谨 + 强依赖 SAE),作者最终也把因果 claim 退守成 skeleton。与 Owner 主研究方向无交集。发布过新无法用 citation 判断,但无 influential signal、未开源、且经同行评审判定未达会议门槛,定 1。若后续 circuit-on-SAE 成主线且本文被当 efficient baseline 频繁引用,可升 2。