Summary

Toy Models of Superposition

  • 核心: 在一个极简的 ReLU autoencoder 里,直接、可控地复现并解剖了 superposition——网络把「比维度更多的特征」以近正交方向塞进低维空间,从而第一次把「神经元为何多义」从 post-hoc 解读升格为有 ground truth 的可观测现象。
  • 方法: 合成稀疏特征 ,训练 ,扫描特征稀疏度 与重要性 ,用 、特征范数、feature dimensionality 把 superposition 显式可视化。
  • 结果: superposition 由 phase change 控制(不学/superposition/独占维度三态突变);高稀疏时特征自组织成 uniform polytopes(antipodal pair / triangle / pentagon / tetrahedron / square antiprism),对应 Thomson problem 解;并能在 superposition 中做计算(abs 任务 + asymmetric superposition motif)。
  • Sources: website
  • Rating: 3 - Foundation(机制可解释性「为什么需要字典学习」的概念地基,直接孕育了后续 SAE / dictionary-learning 主线,社区奠基级影响)

Key Takeaways:

  1. Superposition 是真实可观测的,不只是 post-hoc 解读: 在合成数据上我们知道 ground-truth features,于是能确证模型把 个特征压进 维确实在发生,而非研究者强加的解释。这把 叠加 从假说变成 demonstrated phenomenon。
  2. 稀疏度是开关,相变是机制: 特征几乎全零时,干扰(interference)罕见、ReLU 又能滤掉小噪声,于是「多塞特征」的收益压过「干扰」的代价——superposition 在某个稀疏阈值上不连续地出现。这同时解释了 多义神经元 与单义神经元为何共存于同一层。
  3. 叠加有惊人的几何结构: 均匀 superposition 下特征排成正多胞形(Thomson problem 解),“dimensions per feature” 卡在 1 与 1/2 等分数上;但作者明确警告这部分「太优雅以至于很可能部分是 toy model 的 idiosyncrasy」。
  4. 为什么必须做字典学习: 一旦有 superposition,特征就不再对齐神经元、也无法靠 Gram–Schmidt 逐个剥离,枚举特征 ≈ 做一个巨大的 overcomplete sparse coding——这正是 SAE 路线的动机源头。

Teaser. 随稀疏度增大,线性模型只学 top- 主成分,而 ReLU output model 逐步把更多特征以非正交方向塞入——先以 antipodal pair()出现,再过渡到更复杂几何。 这张图是全文的「实验起点」:左一为线性 baseline,右侧 7 列是稀疏度 从 1.0 降到 0.001 的 ReLU 模型,上排为 (红=对角/真实特征,蓝=非正交干扰),下排为各特征的 superposition 量。


这是一篇 transformer-circuits.pub 的长篇研究 blog(Sept 2022),不是会议论文。下面聚焦它在可解释性谱系中的 delta:它不提出任何「方法」,而是回答一个 why 问题——为什么神经元会多义、为什么后续需要字典学习——并给出一个能被完全掌控的最小实验台。线性表示假设多义残差流 等前置概念已有专门 Note,这里只点链接不重述。

1. 概念栈:feature → direction → privileged basis → superposition

作者把可解释性的隐含假设拆成一个逐层收紧的层级,这是全文的思想骨架:

  • Decomposability(可分解性): 激活可以拆成相互独立、各自可理解的 feature。这是一切 mechanistic interpretability 的前提——没有它就只能把整个模型塞进脑子。
  • Linearity(线性): feature 对应方向。多个 feature 以值 激活时,表示为 。注意:是 feature→activation 这个映射线性,feature 本身仍是输入的非线性函数。详见 线性表示假设
  • Privileged basis(特权基): 只有某些表示(如经过逐元素激活函数的 MLP 神经元)的基方向是特殊的,才值得问「单个神经元是否可解释」。word embedding / residual stream 没有特权基——任意旋转 给出等价模型。
  • Superposition(叠加): 线性表示可以用多于维度数的方向表示特征。形式化判据:线性表示若 不可逆则存在 superposition。它把特征推离神经元,是单义性被破坏的根因。

❓ 这里有个要警惕的张力:整套叙事建立在 linear representation hypothesis 上。作者自己也承认这「不是 trivial claim」。后续 attention/某些 feature 的 non-linear / multi-dimensional 表示(如圆周、日期)已对纯线性视角构成挑战——读这篇时要记住它的几何结论都条件于线性假设成立

为什么神经网络偏爱线性表示?作者给三条理由:(1) 线性表示是「线性层 + 非线性」架构的自然输出,下一层一个神经元可以单步「选中」一个线性特征;(2) 统计效率——方向表示允许非局部泛化;(3) 高维空间里可以有 个「近正交」向量(Johnson–Lindenstrauss),加上 compressed sensing 表明稀疏向量即使被投影到低维也常可恢复。这三点合起来就是 superposition 在直觉上「划算」的根据。

2. 最小实验台:合成稀疏特征 + ReLU autoencoder

要确证 superposition,关键是拥有 ground-truth features——真实模型里没有,但合成数据里有。三条对真实特征的核心假设被编码进合成分布:

  • Feature Sparsity: 自然特征大多稀疏(多数图像位置没有曲线、多数 token 不指向某个名人)。令 以概率 ,否则在 均匀。实验主要取所有特征同稀疏度
  • More Features Than Neurons: 潜在有用特征远多于神经元——这是真实表示的中心张力。
  • Features Vary in Importance: 第 个特征带重要性 (常取 这类几何衰减)。

模型只在最后的激活函数上区分两种:

Equation 1. Linear baseline vs ReLU output model

符号说明 维特征下投影到 维隐层(),再用 上投影恢复; 是偏置。 含义:用同一个 的转置做恢复,避免「哪个方向才是特征」的歧义,且当 近正交时 (compressed sensing 直觉)。唯一区别是最后那个 ReLU——而正是它让模型行为发生质变。

损失是按重要性加权的 MSE:

Equation 2. 加权重构损失

3. 现象:相同模型,加一个 ReLU 就出现 superposition

上面 Teaser 图就是「基本结果」:线性模型无论稀疏度都只学 top- 个最重要特征(等价于 PCA / top principal components);ReLU output model 在 dense()时行为一致,但随稀疏度增大,superposition 涌现——模型先牺牲最不重要的特征、把它们排成 antipodal pair(一个特征方向恰为另一个的负),再逐步过渡到更复杂几何,最终连最重要的特征也进入叠加。

4. 数学理解:feature benefit 对抗 interference,相变是真的

为什么加一个 ReLU 就天差地别?作者把它化简成两股力的博弈

  • 线性情形:借 Saxe et al. 的线性网络学习动力学,可证线性模型永不 superposition——“feature benefit”(表示更多特征降低 loss)始终被 “interference”(,超出可正交容纳就增损)压制,解就是 PCA。
  • ReLU 情形:把损失按稀疏度的二项展开 ,在高稀疏极限只有 (零向量的偏置惩罚)和 (1-sparse 损失)主导。 项在固定 假设下退化成一个广义 Thomson problem——在球面上排点,能量函数略特殊。关键:ReLU 让 1-sparse 情形下负干扰免费,这解释了为什么解偏好 antipodal(负干扰)配置;负偏置还能把小正干扰转成实质负干扰。

由此得到三态:(1) 特征不被学;(2) 学了、放进 superposition;(3) 独占一个维度。三态之间的转换是尖锐的 phase change(这里取「不连续变化」的广义含义)。

Figure 1. Superposition 的相图(,单个 extra feature)。 横轴=extra feature 相对重要性,纵轴=特征密度 。上为实证、下为理论闭式解。三色区域=不表示(灰)/独占维度(蓝)/superposition 即 antipodal pair(红)。理论模型可解析确认这是一阶相变:不同几何的 loss 曲线交叉,导致最优 loss 导数不连续。

这张相图是全文方法论上最干净的一击:它把「superposition 何时发生」从经验观察提升为可解析的相变,并且实证图与理论图高度吻合——这是 toy model 路线最有说服力的地方。

5. 叠加的几何:sticky 分数与正多胞形

把所有特征设成均匀(等重要、等稀疏、独立),看 “dimensions per feature” 随稀疏度变化:

Figure 2. (对数轴)变化,“sticky” 卡在 1 和 1/2。 1/2 对应特征全部排成 antipodal pair(两特征共享一维)。作者还打了个类比:这条曲线「非常隐约地像 fractional quantum Hall effect」。

再按单特征 dimensionality 拆解:

Equation 3. Feature dimensionality(单特征占多少维)

符号说明:分子=该特征被表示的程度;分母=「有多少特征共享它所在的维度」(把所有特征投到 方向)。含义:antipodal pair 中每个特征 ;未学特征 ;独占维度

Figure 3. 单特征 dimensionality 散点 + feature geometry graph。 点聚集在一系列分数上,每个分数对应一种 weight geometry:3/4=tetrahedron(4 特征/3 维)、2/3=triangle、1/2=digon(antipodal pair)、2/5=pentagon、3/8=square antiprism、0=未学。上排图中每个节点是一个特征、边权=特征嵌入向量点积绝对值(正交则不连边)。

这给出两个深刻 takeaway:

  • superposition 不是单一现象——0 与 1 之间的一切 fractional dimensionality 都是 superposition,就像「冰」其实有许多晶体相。
  • 这些几何正是 Thomson problem 解;许多解是更小 uniform polytope 的 tegum product(正交子空间嵌入),tegum 因子间无干扰,这可能正是 toy model 偏好它们的原因。

❓ 作者本人对这一节的态度很诚实:「在某些方面这结构太优雅以至于不像真的,很可能至少部分是我们研究的这个 toy model 的 idiosyncrasy」。读时应把第 4 节(相变、benefit/interference)当作很可能泛化的部分,把第 5 节(具体正多胞形几何、learning dynamics 的 energy-level jump)当作高度不确定、勿过度外推到真实模型的部分——作者在 Discussion 里也是这么分档的。

非均匀情形(特征重要性/稀疏度不等、或相关/反相关)则表现为对均匀几何的形变 + 跳变:相关特征偏好正交(落入不同 tegum 因子,形成 “local almost-orthogonal basis”),空间不够时会坍缩成主成分(PCA-like);反相关特征偏好负干扰(antipodal)。这暗示 PCA 与 superposition 是互补的两种策略,随相关性/稀疏度此消彼长。

6. 在叠加中做计算,不只是存储

更强的主张:网络能直接在 superposition 上做计算。作者改用解耦的 “ReLU hidden layer” 模型 去算 (因为 ,天然需要 ReLU,逼模型真用激活函数)。结果:dense 时每个神经元 = 一个特征(可直接读出),足够稀疏后照样用 superposition 算更多特征的 abs。

机制上出现一个漂亮的 asymmetric superposition motif:一个神经元用不等幅存两特征(如 )+ 倒数输出权重(),让 A 重度干扰 B 而 B 几乎不干扰 A;另一个神经元在会产生正干扰时抑制它,把可能爆 loss 的正干扰转成 ReLU 下后果有限的负干扰。

privileged basis 下还能看到单义↔多义神经元的相变

Figure 4. ReLU hidden layer 模型随稀疏度从全单义→全多义的过渡()。 左为 ,右为 neuron stacked bar plot(每列一个神经元,矩形高=权重绝对值、颜色=作用特征)。 时全单义;稀疏增大后出现「3 特征塞进 2 神经元的二进制码」「features = pairs of neurons」等结构化多义码。关键观察:单义与多义神经元可在同一模型共存,且重要特征(左侧)倾向单义——这与真实视觉/语言模型中「强激活时可解释、弱激活时多义」的经验观察高度吻合。

作者也指出这个「纯存储」ReLU hidden 模型的硬伤:模型不 benefit 于隐层 ReLU,给它任何机会(如正偏置)就会绕过去让神经元工作在线性区——所以 abs 任务(必须用 ReLU)才是更可信的 computation-in-superposition 证据。

7. 战略意义:「解决 superposition」≈ 解决可解释性的核心障碍

作者最关心的不是科学趣味,而是安全:要论证「模型不会做某类有害行为」,需要能枚举所有 feature 这个 universal quantifier。而 superposition 正是枚举的拦路虎——

  • 有 privileged basis 且无 superposition 时,feature=neuron,枚举神经元即可;
  • 一旦 superposition,既不能靠 Gram–Schmidt 逐个剥离方向,cosine similarity 也会因「无关特征带正点积」而误导。

因此「solving superposition」= 能枚举特征 / 能把 superposition 激活「展开」成更大的非叠加模型。三条出路:(1) 训练出无 superposition 的模型(如对隐层加 的 L1 正则;并讨论了 MoE 如何「把神经元稀疏性换成 free flops」从而可能减少 superposition);(2) 事后找 overcomplete basis(即 sparse coding / dictionary learning——明确点名这是标准 sparse coding 问题,对真实 LLM 是百万×十亿规模的巨型分解);(3) 混合方案。作者认为相变带来希望:既然 superposition 是有尖锐相变的相,原则上存在一个完全无 superposition 的 regime,问题只是代价。

这一节是本文在谱系上的承重点:出路 (2) 几乎是逐字描述了一年后 Anthropic「Towards Monosemanticity(SAE)」的纲领。把这篇当作 SAE 路线的 problem formulation 来读最准确。

8. 其余 striking phenomena(作者标注为不确定)

  • Learning dynamics = 离散 energy-level jumps: 大模型训练中特征 dimensionality 在不同值间「跳变」并交换,loss 曲线同步出现突降;作者把它和 induction head 相变、grokking 并列。
  • 学习 = 几何变换序列: 时可直接看到特征点在 3D 中按 loss 曲线的不同 regime 完成一连串几何变换(先 PCA 线性近似,再跳到非线性解)。
  • 与对抗样本的联系: superposition 给最重要特征引入 干扰项 ,提供天然攻击面;实验中对抗脆弱性随 superposition 形成陡增 >3×,且与 features-per-dimension 紧密相关。作者谨慎地不声称 superposition 是真实对抗样本的主因。

关联工作

概念前置(本文所依赖 / 形式化)

  • 线性表示假设: 全文几何结论的地基;作者把它拆成 decomposability + linearity 两条可检验属性。
  • 多义性 / 叠加: 本文正是把 polysemanticity 的成因(superposition)从假说做成可观测现象,并给出 privileged basis × superposition 的二力解释。
  • 残差流: 被作为「无 privileged basis」的真实对应物之一(与 word embedding 并列)。
  • Compressed sensing / Johnson–Lindenstrauss / 神经科学的 distributed & population codes: 作者明确说 superposition 不是新概念,本文的贡献是「在人工网络中无歧义地 demonstrate」。

催生 / 指向的后续主线

  • SAE: 本文第 7 节「找 overcomplete basis」即 sparse coding 纲领,直接孕育了 Anthropic 后续的 monosemanticity / SAE 工作——这是本文在谱系上最重要的下游。
  • Circuits 线程: 本文解释了「为什么 neuron-focused circuit analysis 有时有效」——当激活函数造出 privileged basis 且特征对齐神经元时;同时论证了 superposition 普遍存在时 circuit analysis 为何会失效。
  • 因果中介 / 激活 patching / 忠实性 / 事后 vs 内在: 本文用合成数据「拥有 ground-truth feature」这一点,恰好回应了这些方法共同的痛点——真实模型没有 ground truth 因而难以验证;它也明确区分了「post-hoc 解读」与「ground truth 结构」。

方法相关

  • Thomson problem / uniform polytopes / tegum product: 均匀 superposition 几何的数学外壳。
  • Saxe et al. 线性网络学习动力学: 用来解析证明线性模型不 superposition。
  • MoE: 被当作「改变 flop-neuron 关系、可能减少 superposition」的一个例证(而非推荐方案)。

论文点评

Strengths

  1. Problem formulation 的典范: 它没有发明任何 method,却精确定义了整个 mechanistic interpretability 的核心障碍(superposition)并论证「解决它 ≈ 解决可枚举特征」。后续 SAE 整条线的动机在此被逐字写出——这是 important 而非仅 publishable 的工作。
  2. 可控实验台 + 闭式理论双管齐下: 合成数据让 ground-truth feature 可知,使「superposition 真实存在」从解读变成确证;相变还能在 解析求解并与实证吻合(一阶相变)。benefit/interference 这对直觉极具迁移性。
  3. 罕见的认知诚实: 作者主动给结论分档——相变/单义多义共存「likely generalize」,几何/learning dynamics「much more uncertain,可能是 toy model idiosyncrasy」。这种诚实的自我设限在 toy-model 研究里少见。
  4. 可视化即论证: 、feature dimensionality 散点、neuron stack plot 等把抽象的「方向叠加」变成可读的图,且每张图都承载一个独立 claim。

Weaknesses

  1. toy ≠ real,外推风险大: 全部结论来自 、合成均匀稀疏特征的 ReLU autoencoder。作者只给了「与真实 polysemanticity 观察一致」的弱验证(4 条定性吻合),没有任何在真实大模型上对 superposition 的定量测量。几何/polytope 结论尤其可能不泛化。
  2. 整体条件于 linear representation hypothesis: 若真实特征存在本质非线性 / 多维流形表示(后续工作已有此类证据),本文的方向-几何框架会部分失效。这是隐含的、未被充分压力测试的核心假设。
  3. computation-in-superposition 证据较窄: 仅 abs(x) 一个任务,作者自承不知它是否代表一般计算、是否依赖任务的稀疏结构。asymmetric superposition motif 也只在少数神经元上手工解读,未规模化验证。
  4. “solving superposition” 仍是纲领而非方案: 三条出路在 toy model 都可行,但对真实 LLM 全部「看起来非常困难」;本文给出动机和判据,未给出可工作的解法(这要等后续 SAE)。
  5. 合成数据的 uniform/独立假设过强: 真实特征几乎必然非均匀、相关;非均匀一节只做了「现象罗列」,作者承认「远未有完整理论」。

可信评估

Artifact 可获取性

  • 代码: 未提供官方统一 repo(blog 内以 Colab notebook 链接散落给出若干闭式解推导);本 digest 未发现集中开源仓库。
  • 模型权重: N/A——toy model,按需现训,无 checkpoint 概念。
  • 训练细节: 主要超参(、每点训练多少个取最低 loss)在正文/图注中给出,属「高层 + 关键超参」级别;非端到端可一键复现,但 toy 规模复现门槛极低。
  • 数据集: 合成数据,生成过程在正文完整描述( w.p. ,否则 ;相关/反相关集的构造也写明)。

Claim 可验证性

  • 可信superposition 在 ReLU autoencoder 中真实出现且由稀疏度控制: 合成数据有 ground truth, 与 feature norm 直接可视,结论可复现。
  • 可信superposition 是一阶相变: 有闭式解 + 实证相图吻合,grounding 扎实。
  • 存疑特征自组织成正多胞形 / Thomson 解: 实证清楚,但作者自承「可能是 toy model idiosyncrasy」,向真实模型的泛化未验证。
  • 存疑本文 toy model 反映真实网络: 仅 4 条定性吻合(多义神经元存在、单义多义共存、InceptionV1 深层更多义、Transformer 首层 MLP 极多义)作支撑,无真实模型上的定量证据。
  • 存疑superposition 与对抗样本相关: toy 模型内脆弱性随 superposition 陡增(>3×)成立,但作者明确声称是真实对抗样本主因。
  • 存疑MoE 会有更少 superposition: 基于「loss reduction per activation frequency」的初步分析,作者标注为 preliminary。

Notes

  • 读法建议:把第 1、4、7 节当「会泛化的硬核」,第 5、8 节当「漂亮但存疑的探索」。对本 survey 而言,本文是「为什么需要字典学习 / SAE」这条因果链的起点节点,应与后续 SAE-monosemanticity 笔记成对引用。
  • ❓ 一个值得追问的开放问题(作者也列入 Open Questions):scale 上去后 superposition 会消失、保持恒定比例、还是增加?这直接决定 SAE 路线的长期可行性,但本文无法回答。

Rating

Metrics (as of 2026-06-27): citation=N/A (S2 IP throttled), influential=N/A, velocity=N/A; HF upvotes=N/A (无 arXiv id,transformer-circuits.pub blog); github N/A (无官方代码仓库)

分数:3 - Foundation 理由:本文是机制可解释性「superposition → 为何需要字典学习」这条因果主线的概念地基与 problem formulation 起点,第 7 节几乎逐字写出了后续 SAE / dictionary-learning 整条主线的纲领,属于「只读它就能理解这个方向为何存在」的奠基级工作;其在社区的 followed-by-many 影响力(被 SAE、circuit、feature geometry 等多条线广泛继承)足以支撑 Foundation 档。之所以不是 Frontier(2):它不是某个 SOTA 方法或会过气的 baseline,而是定义问题本身的 why 层工作,时间只会强化其地基地位。今日精确 citation 因 S2 IP throttle 不可得,但其谱系角色已独立支撑该评级。