地基图谱:训练怎样改变模型权重的几何形状。模型合并、continual learning 的遗忘、LoRA 的低秩解释都要回到这里。蒸馏自 从 Checkpoint 平均,到专家蒸馏

Overview

核心问题:训练把权重推到了什么样的参数地形里,后训练又改动了多少、改在哪。 这是一组关于”训练后权重几何”的事实与争论。它本身不解决下游任务,但会决定很多后续判断:权重能不能加减、合并、迁移。

Core Concepts

  • 参数空间、计算图与函数空间:固定 architecture 后,parameter tensors 的 Cartesian product 可以坐标化为 ;这只是给可调数字编号。Graph structure 通过 的 Jacobian、Hessian、Fisher 等进入几何,raw Euclidean metric 则依赖 parameterization。详见 参数空间与计算图
  • 一阶敏感度、二阶曲率与低秩结构:Jacobian 是局部 linear map,SVD 分析它的 amplification directions,Hessian 则针对 scalar objective 给出 signed curvature。三者的 shape 与适用边界见 Jacobian、Hessian 与 SVD
  • Loss landscape 三件套sharp minima(窄坑,泛化差)/ wide basin(宽平盆地,充分训练后的常见归宿)/ barrier(两解之间的山脊,判断”能否直接插值”的关键)
  • Linear Mode Connectivity (LMC):两条轨迹共享一个足够靠后的中间 checkpoint,则末端权重线性插值无 barrier
  • 内在维度 (intrinsic dimension):微调只需在少数方向上发力,刻画一个低维子空间
  • off-principal subspace:更新被系统性导向非主奇异方向、低曲率方向,而非主成分
  • rank-1 / river-valley:滑动平均滤掉山壁横跳后,合并点塌缩到一条朝下坡的直线(第一主成分解释 >94% 方差)
  • 有限学习率的隐式梯度正则:离散 GD 一阶等价于优化 ,为”学习率不宜过小”和 wide basin 偏好提供一个动力学解释
  • 三组必须分清的概念:更新量小 ≠ 能力没变;稀疏 ≠ 低秩;低维 ≠ 稀疏

Established Knowledge

  • 充分训练的大模型通常会落入 wide basin — evidence: Preliminary: Loss Landscape 基本概念;这是权重平均可用的物理前提
  • 共享预训练起点 ⇒ 共 basin ⇒ 末端可线性插值无 barrier — evidence: LMC 与共享 basin 条件(LMC, Frankle 2020)。这是充分非必要条件:permutation 对齐(Git Re-Basin)即使不共享起点也能消 barrier
  • 沿”初始化→终点”直线插值 loss 大体单调下降 — evidence: 同上(Goodfellow 2014);注意这是”零初始化到终点”,不同于”同源多解之间”插值
  • 后训练是小而结构化的扰动:RL 实测只更新 5-30% 子网络,拎出该子网单独训练能近似复现整模型 — evidence: task vector 的几何解释与后训练性质(Mukherjee 2025)
  • 驱动稀疏的是 on-policy / in-distribution,而不是”RL”标签 — evidence: 同上(in-distribution rejection-sampling SFT 同样稀疏;off-policy DPO 反而稠密)
  • SFT delta 高度冗余、低内在维度:随机丢 90%+ 仍几乎不掉点 — evidence: 干扰问题与稀疏化方法(DARE / 内在维度, Aghajanyan 2021)
  • 退火阶段的更新方向高度线性,合并轨迹是 rank-1 — evidence: Extra-Merge 与 rank-1 外推;这条线性让免梯度外推变得可行
  • 权重空间存在 disentanglement:不同方向控制函数空间互相分离的局部功能区 — evidence: task vector 的几何解释与后训练性质(Ortiz-Jiménez 2023);作者强调这强于”局部线性”,且 task vector 之间并不真正正交
  • 有限学习率会引入梯度范数惩罚:full-batch GD 的 backward error analysis 给出一阶 modified loss ,所以过小学习率不仅慢,还会削弱这部分 implicit regularization — evidence: 有限学习率的隐式梯度正则(IGR 2021 / 科学空间推导)
  • 权重平均 ≡ 隐式学习率衰减:对 checkpoint 加权平均等价于给第 步梯度乘系数 ,有效学习率 ;uniform 对应全程线性衰减,sliding 对应 WSD 形状,EMA 对应软化 WSD。这是 WSM「decay ≡ merging」 的数学内核 — evidence: 学习率衰减与权重平均的联系(Abel 求和恒等式 / 科学空间推导)

Active Debates

  • RL 更新到底是不是稀疏的?
    • 稀疏:只动 5–30% 子网络 — Mukherjee 2025
    • 表观稀疏是假象:bf16 精度造成的假稀疏,真机制是更新落进 off-principal 子空间,而非大片参数纹丝不动 — Path Not Taken (RLVR Provably Learns Off the Principals)
    • status: leaning「off-principal 子空间」;务必区分稀疏 ≠ 低秩
  • “flat → 泛化好”是因果还是相关?
    • 常见直觉:平坦盆地 → 更好泛化
    • 反方:SWA 作者本人把增益主要归于 train/test loss 曲面错位,且 sharpness 的定义可被重参数化改写,因而 sharpness 本身不是良定义的因
    • status: leaning「经验相关,非已证因果」

Open Questions

  • rank-1 在多大尺度上会失效(“河”在哪弯掉)? rank-1 是局部性质,大规模长训练上没人系统测过 — related: Update-Anchored Post-Training
  • 内在维度 / off-principal 子空间的方向是否在不同任务间稳定? 若稳定,则可预先定位”该往哪更新”;目前无干净答案

Known Dead Ends

  • 把”flat → 泛化好”当已证因果来用 — why: 只是经验相关;sharpness 可被重参数化改写。先明确 坐标、metric 与 function-space 含义
  • 把”RL 就是稀疏”当简单事实 — why: 表观稀疏很大程度是 bf16 精度假象,真机制是 off-principal 更新
  • 混用稀疏 / 低秩 / 低维 — why: RL 更新可稀疏却近满秩;内在维度讲的是低维子空间(SFT 一侧),不是一回事