概念 | 神经网络把「概念 / 特征」编码为激活空间中的方向,而多个概念以线性方式(沿各自方向加性叠加)组合成一个激活向量。
是什么
Linear Representation Hypothesis(LRH,线性表示假说)是一个关于「神经网络内部如何存放信息」的假设。它主张:模型对某个人类可理解的概念 / 特征(feature)的表示,对应于激活空间(如 residual stream)里的一个固定方向 ;而某一时刻的激活向量 ,约等于当前「激活了的」诸多特征方向的线性加和:
其中 是特征 的强度(intensity), 是它的方向。这个假设有两个可分开检验的子主张:
- 方向性(directionality):单个概念 = 一个线性方向。「这条样本里有没有该概念」可以通过把 投影到 (内积 )读出。
- 可加组合(linear composition / additivity):多个概念共存时,它们的方向线性相加,互不纠缠地叠在同一个向量里。
一个常被引用的直觉例子来自 word embedding 时代的「king − man + woman ≈ queen」:概念(royalty、gender)像是可以做向量加减的独立坐标轴。LRH 把这种直觉推广到深层 Transformer 的中间激活上。
为什么重要(动机)
LRH 是当代机制可解释性(mechanistic interpretability)一大批方法的共同地基——如果它成立,很多操作就立刻变得合法:
- Probing(探针):用一个线性分类器从激活里读出某概念,本质上就是在找那个方向 。线性 probe 有效,是 LRH 的直接证据。
- Steering / activation steering:要让模型「更礼貌」「更拒答」,就往激活里加上对应概念的方向向量()。这只有在「概念是可加方向」时才说得通,参见 Representation Engineering。
- Sparse Autoencoder(SAE)/ dictionary learning:整个 字典学习 范式假设激活是一组特征方向的稀疏线性组合,SAE 学的就是这本「方向字典」。
- 因果干预:activation patching 与 causal mediation 把某方向移植 / 抹除来验证因果作用,背后也预设了「方向 = 可操作的语义单元」。
换句话说,先理解 LRH,才能理解为什么这些方法长成现在这个样子、以及它们在什么前提下才靠谱。它本身并不是一个「方法」,而是一个可证伪的赌注:整个领域押注「线性」是表示的正确抽象层级。
关键细节
(已知,支持证据)线性方法确实大量奏效。 线性 probe 能从中间层读出词性、真假、情感、空间坐标等概念;steering vector 做加减常常能可预测地改变行为;SAE 抽出的方向往往对应单义(monosemantic)特征。这些是 LRH 的经验支撑,也解释了它为何成为默认工作假设。
(已知,机制层面)LRH 与 superposition 互补而非矛盾。 Superposition 说的是:方向数量可以远多于维度 ,特征以「近似正交、可容忍轻微干扰」的方式挤在同一空间里(Toy Models of Superposition)。注意:superposition 仍然假设特征是线性方向,只是放宽了「正交 / 一特征一神经元」。所以 superposition 是 LRH 的精细化,而不是反例。真正威胁 LRH 的是「特征根本不是方向」。
(争议 / 反例)并非所有特征都是单一线性方向。 已有工作发现:
- 多维 / 非线性特征:有些概念(如「星期几」「一年中的月份」这类具有循环结构的量)更像是被编码在一个二维圆环 / 流形上,而非单一方向——即 circular features。此时「投影到一个方向」会丢信息。
- 概念不总是可线性分离:在某些任务里,决定行为的不是「某方向的投影值」,而是激活的非线性函数,线性 probe 读得出相关性却抓不到因果。
- (2025, 争议) non-linear representation dilemma:近期工作质疑——基于线性假设的因果抽象(causal abstraction)方法,可能在表示其实是非线性时给出看似成功实则虚假的解释,从而高估了我们对模型的理解。这把矛头直接指向「用线性方向做因果声明」的忠实性问题。
(常见误解)「线性 probe 有效」不等于「该概念是因果方向」。 probe 测的是可解码性(decodability)——信息在不在激活里;它不保证模型真的用这个方向去计算。一个方向可能可读但因果惰性(读得出却干预无效),也可能模型用的是一个与 probe 学到的不同的方向。区分「相关的方向」与「因果的方向」需要干预实验,这正是 causal mediation / activation patching 的用武之地,也是 LRH 忠实性争论的核心。
与其他概念的关系
- Features & Dictionary Learning:LRH 提供「概念 = 方向、激活 = 稀疏线性组合」的前提,字典学习 / SAE 是兑现这一前提的具体算法。没有 LRH,SAE 的目标函数失去依据。
- Superposition:解释「为什么有限维度能塞下海量线性方向」,是 LRH 在容量受限下的自然推论,二者一起构成「特征即方向」图景。
- Faithfulness:LRH 是否在大模型尺度上、对所有概念都成立,决定了基于线性方向的解释是否忠实。circular features、non-linear representation dilemma 都是从忠实性角度对 LRH 边界的拷问。
- 锚定方法:RepE(steering 依赖可加方向)、SAE Monosemanticity(字典学习兑现 LRH)、DAS 与 Toy Models 则分别从因果干预与 superposition 角度精化 / 检验这一假说。
一句话总结其地位:LRH 不是定论,而是一个经验上极其好用、但边界正在被主动证伪的工作假设——把它当公理用很危险,把它当「目前最好的一阶近似」用才对。