概念 | 神经网络在 维激活空间里塞进多于 个特征——这些特征以彼此非正交的方向「叠加」存储,靠激活的稀疏性把相互干扰压到可接受的水平。
是什么
先约定一个直觉:我们假设网络内部有一批语义上有意义的特征(feature),每个特征对应一个方向,激活时沿该方向「点亮」(这是 线性表征假设 的视角)。最朴素的设想是「一个特征占一个神经元」,于是 维空间只能装 个特征,而且这些特征方向正交、互不干扰。
Superposition 说的是网络并不这么做。 它把 个特征压进同一个 维空间。可以写成
其中 是某层激活向量, 是第 个特征的激活强度, 是它对应的方向。当 时这些 不可能两两正交——任意一对都有非零内积 ,这就是「叠加」一词的来源:多个方向挤在一起,彼此重叠。
为什么这能 work?关键是稀疏性(sparsity)。在真实数据里,绝大多数特征在任一时刻都不激活()——一句话里同时出现「法语」「化学公式」「反讽语气」的概率很低。于是同时点亮的特征很少,几个非正交方向同时出现造成的串扰(cross-talk)在大多数样本上都不会发生。网络相当于做了一个赌注:用「特征几乎总是稀疏的」换取「容量翻好几倍」。
为什么重要(动机)
Superposition 是连接「网络内部到底在算什么」与「我们能不能读懂它」的核心枢纽,几乎是一切机制可解释性方法绕不开的前提:
-
它解释了为什么不能直接读单个神经元。 如果一个神经元只对一个特征响应,那么打开网络就像查字典一样简单。但 superposition 下,单个神经元(即激活空间的某个坐标轴)会同时被许多特征的方向「投影」到,于是它对一堆语义无关的输入都会激活——这正是 多义性 的成因。换句话说,多义性是 superposition 在神经元基(standard basis)下表现出来的症状。
-
它给了字典学习方法存在的理由。 既然特征不是沿坐标轴排列、而是沿一组非正交、过完备(overcomplete,数量 )的方向排列,那么想恢复「真正的特征」就需要去找回这组方向,而不是逐个看神经元。这正是 SAE 要做的事:用一个超过激活维度的字典去稀疏地重建激活,把叠加的特征重新「解叠加」开。
-
它定义了「容量」与「干扰」的根本张力。 模型多塞特征是为了表达力(capacity),代价是引入干扰噪声(interference)。理解这个 trade-off,才能理解为什么模型会在某些输入上「莫名其妙」地出错——本质是某些特征方向的串扰偶然同时被激活。
关键细节
1. Capacity vs. Interference 的本质权衡(已知)。 每多塞一个特征,就给所有已存在的特征方向引入一点点非正交带来的干扰。模型能容忍多少叠加,取决于特征有多稀疏:越稀疏,同时激活的特征越少,串扰期望越低,就能塞越多。直觉上存在一个「预算」——稀疏度决定了 维空间能无害地承载多少有效特征。
2. 随稀疏度出现的相变与几何(来自 toy models,已知但具体形态依设定而变)。 Toy Models of Superposition(Anthropic)用极简模型系统研究了这件事,发现一个有意思的现象:
- 当特征不稀疏时,模型倾向于「老实地」只表示最重要的几个特征、其余直接丢弃,存下来的特征近似正交——不发生叠加。
- 当特征变稀疏后,模型开始把更多特征叠加进来,且这些方向会组织成规整的几何结构。最简单的例子是 antipodal pair(反足对):两个特征共用一条直线、方向相反(),靠「不会同时激活」来共享一个维度。更稀疏时还会出现三角形、五边形乃至更高维多面体(如 tetrahedron)等结构——这些是为了让有限方向尽量「均匀散开」以最小化两两干扰。
- 这种从「不叠加」到「叠加」的转变随稀疏度增加呈现相变(phase transition)式的不连续跳变,而非平滑过渡。
需要诚实标注:这些精确几何(反足、多边形、相变点)是在高度简化的 toy model 里观察到的。它们提供了强有力的概念证据,但「真实大模型内部的叠加是否也呈现这类干净几何」仍是开放问题,不能直接外推。
3. 常见误解。 (a)叠加 ≠ 分布式表示的同义反复——重点不在「特征跨多个神经元」,而在「特征数量超过维度、因而方向必然非正交」。(b)叠加不要求特征严格正交化失败才发生,恰恰相反,它是模型在稀疏前提下主动选择的高效编码策略。(c)「解叠加」不保证唯一:从叠加的激活里恢复原始特征是一个欠定问题,SAE 找到的字典是否就是模型「真正使用」的特征,本身需要 忠实性 检验,存在争议。
4. 边界条件。 Superposition 的整个论证建立在「特征稀疏」之上。若某批特征其实稠密(频繁共现),模型反而倾向给它们分配近正交的专属方向,此时叠加不成立。所以「网络里到处都是叠加」是一种倾向性陈述而非定律。
与其他概念的关系
- 多义性:superposition 是因,polysemanticity 是在神经元基下观察到的果。想讲清楚「为什么一个神经元对多个无关概念响应」,必须回到叠加。
- 线性表征假设:叠加的整套表述(特征 = 方向、激活 = 线性组合)寄生于线性表征假设之上。若特征不是线性编码的,「非正交方向叠加」这个框架本身就要重写——该假设在大模型尺度是否成立仍有争议,见该笔记。
- SAE:直接的「解药」。叠加把特征藏进非正交、过完备的方向集,字典学习就是去把它们重新分离出来的工程手段。
- Toy Models of Superposition:本概念最重要的 anchor paper,相变、antipodal、多边形几何等具体结论均出自此。