Summary
Measuring the Intrinsic Dimension of Objective Landscapes
- 核心: 不在原生 维参数空间里训练,而是把训练限制在一个随机定向的 维子空间内,逐步增大 ,找到”解首次出现”的维数,定义为该问题目标地形的内在维度 ——一个可操作、可比较的”问题难度”度量。
- 方法: ,(好的初始化)和随机投影矩阵 冻结,只训练低维的 (初始化为 0)。用”达到直接训练基线 90% 性能”作约定阈值 。投影 从 dense → sparse → Fastfood 逐级提效以 scale。
- 结果: 很多问题的内在维度远低于直觉(MNIST-FC 750、LeNet 290);同一 dataset 上 在宽/深变化 24× 的模型族里几乎不变(仅变 1.33×)→ 多出的参数只是增加解流形的冗余维度。给出了跨监督/RL 的难度对比(倒立摆 4,比 MNIST 易 ~100×;Atari Pong 6k ≈ CIFAR-10),并副产 100× 级的网络压缩。
- Sources: paper | github
- Rating: 3 - Foundation — “内在维度/低维子空间训练”这条线的奠基论文,直接孕育了 SAID (2021) 与 LoRA 的低秩范式,是 权重空间几何 的地基事实之一。
Key Takeaways:
- 内在维度 = 解集的余维度: 在 框架下( 是解流形维度), 是”为解出问题真正需要约束对的方向数”,用随机子空间训练给出它的上界估计。
- 过参数化的真相: 同 dataset 下 对模型大小高度不敏感——每加一个参数几乎只是给解流形增加一维冗余 ,而非降低问题难度。这是对”参数量 = 问题难度”直觉的直接证伪。
- 当 MDL 上界用: 个浮点数即可重建网络(存两个随机种子 + ),于是 是解的最小描述长度上界,可用来有原则地比较模型对任务的适配度(LeNet 290 < FC 750 ⟹ 卷积更适合 MNIST)。
- 跨域难度标尺: 第一次把监督学习与 RL 放到同一把尺子上量——倒立摆只需 4 维,humanoid 行走 700 维 ≈ MNIST-FC,Pong 像素到动作 6k ≈ CIFAR-10。
随机子空间训练的几何构造,以及一个 toy 问题上 的验证:
Figure 1. (左) 直接训练的参数向量;(中) 的随机子空间;(右)toy 问题性能 vs 子空间维度,在 处同时达到 90% 和 100% 可解。

方法:随机子空间训练
定义——内在维度是解集的余维度
先用一个 toy 问题立起直觉。,cost 要求前 100 个元素之和为 1、第二组 100 个之和为 2……分 10 组共 10 个约束。从高斯初始化的 出发可优化到 cost≈0。关键在于解高度冗余:解流形是一个 990 维超平面(从任一零 cost 点出发有 990 个正交方向移动仍保持零 cost)。
记解集维度为 ,定义内在维度 为解集在 中的余维度(codimension):
这里 (1000 = 10 + 990),直觉上等于施加在参数向量上的约束数。空间虽大(),但”需要做对的事情”很少()。
这是论文最干净的概念支点:把”问题难度”等同于”解集的余维度”,而非参数量。
怎么测——把训练塞进随机子空间
一般问题(如带数据依赖损失的神经网络)无法解析求 。论文的核心 trick 是用随机子空间优化去近似它。标准训练(论文称 direct 方法)在 全空间求梯度走步;子空间训练改为:
符号说明:
- :随机生成并冻结的初始参数(用 Glorot/He 等好初始化方案)。
- :随机生成并冻结的投影矩阵,列归一化为单位长度(近似正交,靠高维随机向量天然的近正交性,不显式正交化)。
- :唯一可训练的低维参数,初始化为全 0,故初始时 。
几个关键设计选择(论文逐条论证):
- 为什么从 而非原点起步:让网络受益于精心设计的初始化方案(落在 well-conditioned 区域),SGD/Adam 才好用。
- 为什么用随机定向子空间:把训练子空间与解集放到彼此的 general position,避免子空间和解集都围绕原点/坐标轴对齐而人为偏向(不)相交的病态情形。
- 退化情形自洽: 且 恢复 direct 训练; 且 为随机旋转,则得到 direct 问题的旋转版(对 SGD 这种 rotation-invariant 优化器解不变,但对 RMSProp/Adam 这类有 axis-aligned 假设的优化器路径会变)。
- 相交几乎确定性:当 解集余维度时,解几乎必然(概率 1)不出现; 且解集是超平面时几乎必然相交(任意拓扑解集则不保证)。于是迭代增大 、重训、检查解是否出现,即得 的一个估计。
90% 阈值这个人为约定
真实数据的损失从不恰为零,必须先有一个”解 vs 非解”的启发式判据。论文取相对基线的性能阈值:监督用 validation accuracy,RL 用 total reward(平移到最小为 0),基线一般取最好的 direct 训练模型。
- (性能与基线统计不可分)被观测到剧烈波动:要匹配一个调得很好的基线时它能接近 ;但子空间限制带来的正则又能让性能微涨而骤降——不稳定。
- 于是改用 (性能 ≥ 基线 90%)。90% 是看了一批 dimension-vs-performance 曲线后选的折中:阈值太高,则准确率的微小训练噪声会让”穿越维度”剧烈漂移;太低则不保证解够好。
注意:这个 90% 是人为约定,论文自己也承认”换个阈值结论应当定性不变,但 的绝对值会变”。这是后文点评里 ID 绝对值不可比的根源。
三种随机投影——为了 scale
dense 的时间/空间都是 ,超过 MNIST 规模就吃不消(CIFAR-10 上 推不过 1000)。论文给出三级提效:
Table S4. 三种投影方法的复杂度与单次 forward+backward 实测耗时( 固定为 的 1%,带 * 为 OOM 外推值)。
| 方法 | 时间复杂度 | 空间复杂度 | =100k | =1M | =60M |
|---|---|---|---|---|---|
| Dense | 0.0169 s | 1.07 s* | 4399 s* | ||
| Sparse | 0.0002 s | 0.0019 s | 0.53 s* | ||
| Fastfood | 0.0181 s | 0.0195 s | 0.79 s |
- Dense:独立标准正态、列归一化,靠独立性近似正交。简单但 不 scale。
- Sparse(Li 2006):每个元素以 概率非零(非零则等概率 ±同幅值),理论 。TensorFlow SparseTensor 实测只拿到约 10× 常数加速,且非零元 24 字节内存占用大。用于 CIFAR-10。
- Fastfood(Le 2013):不显式存矩阵,把随机高斯方阵隐式因子化为 ( 随机 ±1 对角、 Hadamard、 随机置换、 标准正态对角),用 Fast Walsh-Hadamard 变换在 时间、 空间完成。用于 ImageNet 和 Pong(1M 参数卷积策略网)。
实验结论
MNIST:低得惊人,且对模型大小鲁棒
Figure 2. MNIST 上性能 vs 子空间维度 :(左)784–200–200–10 的 FC 网络(=199,210),(右)卷积网 LeNet(=44,426)。实线为 direct 基线,虚线为 90% 阈值。 分别为 750 和 290。

- FC 网络 :仅用 0.4% 的自由度即达基线 90%。由此得一个极简压缩法——只存 ① 生成 的随机种子、② 生成 的随机种子、③ 750 个浮点数 ,压缩 260×(793kB → 3.2kB)。
- LeNet (压缩 ~150×),低于 FC ⟹ LeNet 是更适配 MNIST 的模型(MDL 视角:精度相同时 MDL 更短者更优)。
Figure 3. 20 个不同宽度(50–400)/深度(1–5 层)FC 模型的 vs 原生参数量 。 跨度 24.1×, 仅变 1.33×。

这是全文最 striking 的结论:每多一个参数,几乎只是给解的冗余 加一维。 大模型更易训练,可能正因为解集冗余更高、在空间里”覆盖”更广(论文谨慎地把 claim 限制为 ,而非解集体积更大——不同维度空间的体积不可比)。
泛化/记忆探针(呼应 Zhang 2017):
- Shuffled pixels:FC 不变(仍 750,FC 对输入置换不变),但 LeNet 从 290 升到 1400(卷积的局部假设被破坏)—— 能定量暴露”卷积先验是否适配”。
- Shuffled labels:记忆 50k 随机标签需 (每个标签 3.8 floats)。且记忆越多、每标签越省(100%→3.8,10%→18.0 floats/label)——暗示训练集内部存在某种”共享记忆基建”式的 within-training-set 泛化。
跨域难度标尺
Table 1. 各监督/RL 问题的 。
| Dataset | Net | ||
|---|---|---|---|
| MNIST | FC | 199,210 | 750 |
| MNIST | LeNet | 44,426 | 290 |
| MNIST (Shuf Pixels) | LeNet | 44,426 | 1,400 |
| MNIST (Shuf Labels) | FC | 959,610 | 190,000 |
| CIFAR-10 | FC | 656,810 | 9,000 |
| CIFAR-10 | LeNet | 62,006 | 2,900 |
| ImageNet | SqueezeNet | 1,248,424 | > 500k |
| Inverted Pendulum | FC | 562 | 4 |
| Humanoid | FC | 166,673 | 700 |
| Atari Pong | ConvNet | 1,005,974 | 6,000 |
- CIFAR-10 定性同 MNIST 但维度更高(FC 9k、LeNet 2.9k);架构间差异显著:要 >50% 验证准确率,FC/LeNet/ResNet 分别需 9k/2.9k/1k ⟹ ResNet 参数效率更高。补充实验(S10)把卷积拆成 local-connectivity 与 weight-tying 两个因素,证明两者各自都在压低 。
- ImageNet 受时间/显存限制只得到 k 的下界。
RL:第一次和监督学习同尺度
Figure 5. ES 算法在(左)InvertedPendulum-v1、(中)Humanoid-v1、(右)Pong-v0 上的结果, 分别为 4、700、6k。

- 倒立摆 :4 个参数即完美求解,比 MNIST-FC 易约 100×(也呼应 Stanley & Miikkulainen 用 evolution 找到的极小解)。
- Humanoid 行走 ≈ MNIST-FC,远低于 CIFAR-10 卷积——“学会走路比分类 CIFAR 图像简单”,反直觉。
- Atari Pong(像素到动作)k ≈ CIFAR-10 量级。
- 补充:DQN 在 CartPole/Pole/Cart 上 ——“扶正杆子”比”驱动小车”难得多,是同时做两者时的主要难度来源。
副产品:子空间训练作为隐式正则
补充实验(S8)显示子空间训练本身是一种强正则: 较小时 train/test gap 更小,在弱 weight-decay / 弱 dropout 设定下测试 NLL 甚至优于 direct 训练。机制上它与 weight decay 不同——后者把权重压向 0,前者直接削减解空间的维数。
关联工作
基于
- 好的初始化方案(Glorot & Bengio 2010;He 2015): 子空间训练从 起步、 零初始化的设计直接依赖它们,使网络从 well-conditioned 区域出发。
- 随机投影理论(Li 2006 very sparse projection;Le 2013 Fastfood): 提供 scale 到大网络的高效投影手段。
- MDL(Rissanen 1978;Hinton & Van Camp 1993): 作 MDL 上界的理论依据——精度相同时 MDL 最短者最优。
对比
- Loss landscape 既有刻画(Dauphin 2014 鞍点遍布;Goodfellow 2015 初末点间路径近单调): 同样是”切片/约束”地形以理解它,本文是另一种切法——随机线性切片。
- 数据集内在维度估计(Camastra 2002;Levina & Bickel 2005;Tenenbaum 2000): 本文测的是表示 的模型所需自由度(可能随数据规模饱和),而非表示数据集 所需自由度(随规模增长),两者不同。
- 网络压缩(Denil 2013;Wen 2016;Han 2016 Deep Compression;Louizos 2017 Bayesian Compression): 本文压缩更简单(一次端到端训练、任意 base model 可用),但只减自由度数、不减每自由度比特数,也不加速推理,压缩率不及 Bayesian 法。weight pruning / weight tying 可统一解释为”子空间训练的特例”(前者是与坐标轴正交的子空间,后者是沿对角线的子空间)。
方法相关
- Zhang 2017(rethinking generalization): 本文用 把”正常训练”与”记忆随机标签”区分开——后者 高达 190k,给”记忆 vs 泛化”一个定量探针。
- 后续脉络: SAID(Intrinsic Dimensionality Explains LM Fine-Tuning, 2021)把同一思想搬到预训练模型微调,直接孕育了 LoRA 的低秩范式;见 权重空间几何 对”内在维度/低秩”地基事实的汇总。
论文点评
Strengths
- 概念支点干净且可操作:把模糊的”问题难度”还原为”解集余维度”这一可测量、可跨域比较的标量。方法 simple(一个随机投影 + 阈值 sweep)、scalable(dense→sparse→Fastfood)、generalizable(监督/RL 通吃)——正中 simple-scalable-generalizable 的品味。
- 过参数化结论的杀伤力: 对模型大小近乎不变(24× 参数仅 1.33× ID)是对”参数量≈难度”直觉的硬证伪,且是直接测量而非理论推断,信息量极高。
- 真正的跨域标尺:第一次让 MNIST、CIFAR、Atari、MuJoCo 在同一把尺子上排队,催生了一批可比较的直觉(走路 < 分类 CIFAR)。
- 理论联系丰富但不过度声张:MDL 上界、与 pruning/weight-tying 的统一解释、隐式正则,几条线都点到为止、自承边界(如反复强调体积不可比、bound 松紧未知)。
Weaknesses
- 测的是”存在低维解”,不是”SGD 实际走的维数”:随机子空间能否命中解集,与优化器真实轨迹所处的有效维度是两件事。 是”随便切一刀就能撞上解的最小切面维度”的上界,不等于学习动力学的内在维度——把它当后者解读会过度外推。
- ID 绝对值不稳定、不可比:依赖人为的 90% 阈值 + 随机投影质量 + 基线选择(global vs per-model),补充材料里同一 MNIST-FC 在不同约定下从 650 到 750 浮动,CIFAR-FC 随基线定义在 1.52× 与 5.0× 间摇摆。跨论文比较 绝对值意义有限,只有同一约定下的相对大小可信。
- 依赖直接训练基线: 锚定在”最好的 direct 模型”,基线本身的调参好坏直接平移 ID,ImageNet 上甚至因没训好基线而只能给下界。
- 随机线性子空间未必最优:论文自己指出可构造更可能含解的(非)线性子空间——“随机”是为了无偏和简单,但也意味着 ID 估计偏保守(真实最小描述长度可能更低)。
可信评估
Artifact 可获取性
- 代码: inference+training,开源(uber-research/intrinsic-dimension,MIT,Jupyter/TensorFlow),含三种投影实现。
- 模型权重: 未发布 checkpoint(方法本身只需存随机种子 + ,无传统 checkpoint 概念)。
- 训练细节: 较完整——RL 超参(、Adam LR、ES 、迭代数)见 Table S3,网络结构、阈值约定、bootstrap 方差估计均披露。
- 数据集: 全公开标准 benchmark(MNIST / CIFAR-10 / ImageNet / OpenAI Gym + MuJoCo + Atari)。
Claim 可验证性
- 可信:“MNIST-FC 、LeNet 290 等具体数值”:开源代码 + 标准数据集可独立复现;论文给了误差棒与多 run bootstrap。
- 可信:” 对模型大小鲁棒(24× 参数仅 1.33× ID)“:20 模型 grid sweep 支撑,证据扎实。
- 存疑:” 度量问题难度”:成立但限定在”同一阈值/基线约定下的相对难度”;绝对值受 90% 阈值与投影质量影响,论文自承换阈值数值会变。
- 存疑:” 是 MDL 的上界且与真实 MDL 相关”:上界成立,但松紧未知、是否真与 MDL 相关未验证(论文诚实标注)。
- 存疑:“走路比分类 CIFAR 简单”:基于 这一特定度量,换度量未必成立,属”在此尺子下”的相对陈述。
Notes
- 对 Owner 的直接相关性:这是 权重空间几何 里”内在维度/低维子空间”这条地基线的源头。“SFT delta 低内在维度、随机丢 90% 不掉点”(SAID / DARE)、LoRA 的低秩假设、乃至 RL 更新落入低维 off-principal 子空间的争论,方法论上都可追溯到这篇的”随机子空间训练”。
- 一个值得带走的辨析:本文的 ID = “解集余维度的上界”,与后续 LMC / off-principal 文献里”更新实际所处的低维方向”是不同的低维性——前者是静态地形性质,后者是动力学性质。混用二者是这条线里常见的 sloppy 之处。
- ❓ 子空间训练对深层 FC 反而更稳定(L>5 时 direct 发散、subspace 不发散,S5.3),论文归因于”每个随机基向量跨所有 参数 ⟹ 问题更 well-conditioned”。这条与”ID 度量难度”主线关系不大,但作为优化 trick 本身有意思,且暗示随机投影有 preconditioning 效果。
Rating
Metrics (as of 2026-06-27): citation=554, influential=60 (10.8%), velocity=5.5/mo; HF upvotes=0; github 218⭐ / forks=37 / 90d commits=0 / pushed ~2960d ago · stale
分数: 3 - Foundation 理由: 8 年 554 引用、influential 占比 10.8%(健康的”被实质继承”形态),且开创了一整条”内在维度 / 低维子空间训练”的研究线——SAID (2021) 把它搬到 LM 微调,进而成为 LoRA 低秩范式的概念前身,是理解 权重空间几何 与低秩适配脉络的必读源头。虽然 repo 已 stale(star 仅反映历史影响力),但其概念地位由后续工作的继承性而非代码活跃度支撑,稳居 Foundation 而非 Frontier(它已不是当前 SOTA 方法,而是被引为奠基 reference)。