概念地图:一个高维系统的”有效自由度”远小于其表观维度。这个 motif 在 DL 里有两个同名但不同物的版本——别混。| 2026-06

结论先行

“Intrinsic Dimension”(ID)在深度学习里被用来指两件不同的事,混用是大量 over-claim 的来源:

(A) 表示/数据 ID(B) 目标/参数 ID
问的问题这团点云实际躺在几维流形上?解决这个任务最少需要几个自由参数?
测什么激活 / 数据点的几何优化地形(loss landscape)的”可解切面”
典型估计TwoNN、TLE 等 kNN 估计器;PCA随机子空间投影 + 性能阈值
空间表征空间 / 输入空间参数空间
代表作TwoNN (2017)、InferenceManifolds随机子空间投影 (2018)、SAID (2021)

两者共享同一直觉——高维系统的有效自由度其实很低——但测的对象、能支撑的 claim 完全不同。本笔记主要展开 (B) 线(它直通 PEFT / LoRA 和 权重空间几何),(A) 线只做边界澄清。


(B) 目标/参数 ID:奠基的两篇

1. 定义 ID 的方法 — 随机子空间投影 (2018)

Measuring the Intrinsic Dimension of Objective Landscapes (ICLR 2018)

核心 trick:不在原始 维参数空间训练,而是把权重约束在一个随机定向的低维子空间里:

其中 (随机初始化)和投影矩阵 冻结,只训练低维的 (零初始化)。从小到大扫 首次能达到 direct baseline 90% 性能的那个 ,定义为该任务目标地形的内在维度

  • ID 把”任务难度”与”参数量”解耦:MNIST-FC ≈ 750、LeNet ≈ 290;倒立摆 ≈ 4、Humanoid ≈ 700、Pong-from-pixels ≈ 6k(≈ CIFAR-10)。
  • 对模型大小近乎不变(24× 参数只带来 1.33× ID)——说明它测的是任务,不是网络。

2. 用 ID 解释微调 — SAID (2021)

Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning (ACL 2021)

把同一个随机投影 trick 搬到预训练模型微调上,回答:“为什么上亿参数 + 几百样本 + 几乎无正则的微调不崩?”

  • 招牌结果:RoBERTa-Large 在 MRPC 上只训 ~200 个投影参数就达 full fine-tuning 的 90%。
  • 两个 claim:① 预训练隐式最小化 ID(预训练越久 ID 越低);② 越大的模型 ID 越低——所以大模型反而更好微调。
  • 给出与全参数量无关、只依赖 的 compression-based generalization bound。

这篇是 LoRA 的直接思想前身:“微调更新落在低维/低秩子空间” → 直接显式参数化成 low-rank adaptation。


为什么这条线重要(Connect)

  • PEFT / LoRA 的 why:ID 低 → 低维/低秩更新就够 → 解释了 LoRA、prefix-tuning 这一整类方法为何 work。这是”先有现象(ID 低),后有方法(显式低秩)“的典型。
  • 接进 权重空间几何:该 domain map 已把”内在维度”列为 core concept,并强调 低维 ≠ 稀疏 ≠ 低秩 三者必须分清——SFT delta 低内在维度(随机丢 90%+ 不掉点),但 RL 更新可稀疏却近满秩。ID 是 SFT 一侧的性质。
  • Continual Learning hook(Owner 方向):若不同 task 的解都落在各自的低维子空间,子空间之间的重叠 / 正交就直接关系到 interference vs. forgetting——这是个值得追的 problem formulation。related: Open Questions 里”内在维度/off-principal 子空间的方向是否在任务间稳定”。

关键边界 / 批判(Read Critically)

  1. (B) 测的是”存在低维解”,不是”SGD 实际走的维数”。 是”随便切一刀随机子空间就能撞上解集的最小切面维度”——一个静态地形的上界。它不等于优化轨迹实际所处的低维方向(那是动力学性质,见 权重几何 里的 off-principal subspace / LMC 线)。把二者混用是这条文献最常见的 over-claim。

  2. ID 绝对值不可跨论文比较。 “90% 阈值”是人为约定,叠加随机投影族(dense / sparse / Fastfood)的质量和 baseline 选择(global vs per-model),同一任务的 ID 数字会在很大区间里漂。只有同一约定下的相对大小可信——引用 “200 参数” / “ID=750” 这类数字时务必带上 setup。

  3. “大模型 ID 更低” 的 grounding 弱于 “预训练降低 ID”。 后者因果干净(预训练不碰 downstream 数据);前者是对现成模型的观察研究,参数量与预训练数据/步数/架构高度 confound,作者自己也承认理想的”只 scale 架构”对照做不起。

  4. (A) 与 (B) 别交叉引用论证。 表征空间 ID 低(推理轨迹坍缩到 <10 维)和参数空间 ID 低是两个独立现象,一个讲 inference 时激活几何,一个讲微调可达性,不能互相佐证。


待办 / 可扩展

  • (A) 线单独成节或单开笔记:TwoNN / MLE / TLE 估计器的原理与偏差,表征 ID 在 LLM 可解释性里的用法。
  • 补 LoRA 原文笔记,把”ID → 显式低秩”这一步的 formulation 钉死。
  • CL × 低维子空间 idea seed:子空间正交化能否当 anti-forgetting 约束?检索是否已有工作。