技术笔记 | 用一个求和恒等式把「权重平均」和「学习率衰减」翻译成同一件事:对所有 checkpoint 做加权平均,等价于给过去每一步梯度乘上一个「未来还有多少 checkpoint 会继承它」的系数 ,而 就是一条隐式的 LR schedule。可复用工具是 Abel 求和 / 交换求和顺序。| 2026-07
本文是对苏剑林《科学空间》一篇博文(kexue.fm/archives/11804)的个人学习改写与公式展开,把原文的直觉压缩成一条主线,并补上 preliminaries 与几处解释。原文的问题语境是:LR schedule 对训练很重要,而 Schedule-Free(The Road Less Scheduled)这类方法试图用权重平均来部分替代显式调度。那么这两者到底是什么关系?
这条线在本 notebook 里不是孤立的:WSM 已经 claim 过「LR decay ≡ merging 数学等价」,但只给了结论;本文补上为什么等价的那半页推导。它也和 有限学习率的隐式梯度正则 互为镜像:那篇讲步长大小如何隐式改写优化目标,本篇讲步长的时间分布如何被平均操作隐式改写。
结论先行
设 SGD 更新为 ,则任一中间权重是初值减去前缀梯度和:
对所有 checkpoint 做加权平均 (),交换求和顺序后得到:
其中
是「第 步梯度会被多少(加权计)未来 checkpoint 继承到最终平均模型里」。于是平均模型 = 用一条被 压过的有效学习率 训练、再返回末点。也就是说,权重平均本身就在制造一种隐式 learning rate decay。不同的平均权重 ,对应不同的隐式 schedule 形状:
- Uniform average ,从第一步就开始的线性衰减到 0;
- Sliding window(最后 个) 前 步系数恒为 1、最后 步线性衰减,形状就是 WSD;
- EMA(衰减率 ) ,一条软化的 WSD,衰减窗宽由 EMA 半衰期决定。
推论:Schedule-Free 之所以叫 “schedule-free” 却没真的逃离 schedule,是因为它减少了显式指定总步数 的需求,但平均权重的方式本身仍然决定了有效学习率曲线。
1. 问题:LR schedule 和权重平均,是不是两件事?
两个经验事实通常被分开讲:
- LR schedule 很重要。cosine decay、WSD 的 decay 段、末期 annealing,把学习率在训练后段压下去,几乎是拿高分的标配。
- 权重平均很有用。SWA、EMA、Model Soup、PMA,把训练轨迹上的若干 checkpoint 平均一下,泛化更好,甚至能省掉退火段。
Schedule-Free 把两者摆到了对立面:它主张用权重平均来替代 LR schedule。这就逼出一个问题:如果平均能替代衰减,那它们会不会本来就是同一件事的两种写法?
本文的答案是:是。存在一个初等的求和恒等式,把「怎么加权平均 checkpoint」精确翻译成「用了怎样一条学习率曲线」。这不是类比,是等式。
2. Preliminary:两个求和工具
原文推导只用到两件小工具,但它们是理解整条线的支点,这里先摊开。
2.1 交换有限求和的顺序(离散 Fubini)
我们会遇到形如 的双重和。它的求和区域是一个三角:
左边先固定 、 从 扫到 ;右边先固定 、 从 扫到 。同一片三角区域的两种切法,因此对任意被求和项都有:
有限项无需任何收敛条件,纯粹是「换个方向数格子」。关键在换序后内层那个 。它把「对未来所有 求和」显式化,正是 的来源。
2.2 Abel 求和 / 分部求和(这才是恒等式的本体)
上面的换序,放到「部分和的加权平均」这个具体场景里,就是分部求和(summation by parts,连续情形的分部积分的离散版)。
设增量序列 ,其前缀和 (这里 )。对前缀和做加权平均,Abel 求和给出:
直觉是:平均一串「累加量」,等价于给每个「增量」按它被多少个累加量共享来加权。 就是这个「共享计数」(tail sum,尾部权重和)。第 3 节只是把 代进去。
3. 从 checkpoint 展开到「有效学习率」
第一步:展开单个 checkpoint。 SGD 更新 逐步累加( 从 到 ):
第二步:加权平均。 取 checkpoint 集合 ,权重 归一 :
第三步:交换求和顺序(用 2.1 的三角换序,):
第四步:读出有效学习率。 把 并入步长,定义
于是
这个式子和「用学习率 跑 SGD、返回末点」形式完全一致。 平均操作没有引入任何新的梯度信息,它做的全部事情就是逐步重新加权已有的梯度;而重新加权一条梯度序列的时间分布,正是 LR schedule 的定义。
一个诚实的边界要现在就标:这里把 当成「只依赖到第 步为止轨迹」的量,也就是把它当作固定的历史增量来重排。真实训练里 依赖于轨迹本身,而不同的有效学习率会走出不同的 、进而不同的 。所以严格说,这个恒等式是对同一条已发生轨迹的事后重写(post-hoc re-weighting),它精确解释「给定这条轨迹,平均等于哪条 schedule」,但不直接等于「换一条 schedule 从头训会得到平均模型」。这也是为什么下文所有 claim 都建立在 checkpoint 已经在同一片连通低损失区域(见 权重空间几何)这个前提上。
4. 到底在说什么
是第 步梯度被多少(加权计)未来 checkpoint 继承。它天然是 的递减函数: 越靠后, 的项越少, 越小。于是:
- 越早的梯度, 越接近 1。它出现在几乎所有被平均的 checkpoint 里,有效步长几乎不打折。
- 越晚的梯度, 越小。只有少数末端 checkpoint 见过它,有效步长被压低。
这就是「平均自动制造衰减」的机制:不是把学习率随时间调小,而是让最近的更新在最终模型里天然被打折,因为它们被平均进来的次数少。两种视角在 这里合流:「末期把 LR 调小」和「末期梯度进入平均的次数少」是同一根曲线。
还有个干净的性质:因为 ,所以 (所有权重都在未来)、、并且 。也就是说相邻 的落差就是那一步的平均权重。权重分布 与有效 LR 衰减曲线 互为「密度」与「生存函数(尾概率)」的关系。想设计一条衰减曲线,等价于设计一个 checkpoint 权重分布,反之亦然。
5. 三种平均 = 三种隐式 schedule
把三种常见平均方式代进 ,直接读出它们的隐式 LR 曲线。
5.1 Uniform average:从第一步就开始的线性衰减
():
在恒定 下,这精确是一条从 线性衰减到 的 schedule。所以「用 constant LR 训练、最后返回 uniform 平均模型」在数学上就约等于「用 linear-decay-to-zero 训练、返回末点」。
但 uniform 常常打不过 sliding / EMA,恒等式给出了原因: 从第一步就开始下降。也就是它从训练一开始就在削弱有效学习率、过早地「保守」,把本该大步走的探索期也压小了。对大模型预训练尤其吃亏,因为前期需要沿 loss valley 大步前进,不该这么早降速。
5.2 Sliding window(最后 个):这就是 WSD 的形状
只平均末尾 个 checkpoint,(),其余为 0:
前 步系数恒为 1(有效 LR 不打折)、最后 步才线性衰减到 0。这就是 WSD(Warmup–Stable–Decay) 的 Stable→Decay 形状:前期保持高学习率一路探索,末段短促退火收敛。直觉上更适合大模型:前期要沿河谷大步走,后期才需要降噪精修。这也从「平均」这一侧解释了为什么 Early-WA 会 claim「checkpoint 平均 ≈ post-hoc 学习率退火的替身」。sliding 平均的隐式 schedule 本就是一段 stable + 一段 decay。
5.3 EMA:一条软化的 WSD
权重 EMA ,展开末点权重(大 、 下近似归一):
代入 ,用几何级数 :
读法:对早期梯度( 大),,不打折;只有最后约 步内 才明显掉下来。所以 EMA 是「圆角版 WSD」:sliding window 的衰减段是硬线性,EMA 换成一条指数软化的衰减,衰减窗的宽度由 EMA 半衰期 决定。 越大、半衰期越长、衰减段越靠前展开。
这条 EMA 推导原文没有展开,是本篇补上的部分。它解释了「为什么 PMA 里等权 vs EMA 差异基本可忽略」:两者只是 尾部形状(硬线性 vs 指数软化)的差别,主干(前段恒 1、末段衰减)完全一致。
6. 回到 Schedule-Free:free 在哪里
现在可以说清 Schedule-Free 的地位。它的确减少了对显式 schedule 的依赖,尤其是不用预先指定总步数 (cosine/WSD 的 decay 都需要知道终点在哪)。但从恒等式看:
- Schedule-Free 用的是一种在线权重平均(可写成某组 ),所以它照样对应一条隐式有效 LR 曲线 ;
- 平均的方式本身就是 schedule。平均窗宽、EMA 半衰期、插值系数,这些超参没有消失,只是从「显式的 LR 曲线」搬进了「平均的形状」。
所以更准确的说法是:Schedule-Free 把 schedule 从「时间轴上的 LR 显式函数」换参数化成了「平均权重的隐式函数」,并顺带免掉了 horizon 这个最麻烦的显式依赖。它减少的是显式性和对 的依赖,不是 schedule 本身。Schedule-Free 论文也把自己放在「统一 scheduling 与 iterate averaging」的理论框架里,而不是声称消灭了 schedule(The Road Less Scheduled)。
把整条线压成三句:
- 权重平均与学习率衰减不是两个独立技巧,它们通过求和恒等式 互相翻译。
- Uniform averaging 对应「从第一步就线性衰减」,所以常过早降低有效学习率;sliding / EMA / Schedule-Free 的优势来自更合理的隐式衰减形状(前段保持 + 末段收敛)。
- 没有方法真正摆脱 schedule:平均窗、EMA 半衰期、插值系数仍是隐含 schedule,只是换了一个参数化。
7. 与 anytime pretraining 的关系
如果总训练时长未知,这套视角给出一个自然配方:用 constant LR 或 这类 horizon-free step size 训练,再叠加 weight averaging,让任意中途 checkpoint 都有不错表现(Anytime Pretraining)。恒等式解释了它为什么合理:horizon-free step size 负责「不预设 」,而平均负责「在每个中途点自动补上一段隐式 decay」。因为对任意截断时刻 , 都会给出一条到该点为止的衰减曲线。这与本 notebook 里 Update-Anchored Post-Training 关心的「训练轨迹里携带可复用几何信息」是同一直觉的不同用法。
8. 边界与批判
- 这是事后重写,不是从头等价。 恒等式把 当固定历史增量重排(见第 3 节末的方框),精确成立于「给定这条已发生轨迹」。换一条 从头训会走出不同的 ,未必收敛到同一个平均模型。它是解释工具,不是「平均严格 = 某条 schedule 从头训」的证明。
- 依赖 checkpoint 落在同一连通低损失区域。 加权平均权重要有意义,前提是这些 之间没有 barrier。这由 权重空间几何(共享起点 ⇒ 共 basin、river-valley)撑着,跨独立训练的模型直接套这个恒等式没有意义。
- 只处理了「时间维的重加权」,没处理优化器几何。 推导默认更新是 。Adam/AdamW 引入 preconditioner, 已被逐坐标缩放,「有效学习率」是各向异性的;动量则让单步不再是纯梯度。这些不推翻主结论(平均 ↔ 隐式 schedule),但让 与真实各方向步长的对应变复杂。
- 和 IGR 是两种不同的隐式效应,别混。 IGR 讲的是步长大小 隐式改写优化目标(加 );本篇讲的是步长的时间分布被平均隐式改写。一个关于「多大」,一个关于「何时」,可以叠加但机制正交。
- 「更好的 形状」是经验判断。 「前段保持 + 末段衰减优于全程衰减」有大量经验支撑(WSD/PMA/Early-WA),但最优形状依赖数据、规模、优化器,不是恒等式能单独定出来的。
与其他概念的关系
- WSM(学习率衰减与合并等价):WSM 从工程侧 claim「decay ≡ merging」并据此设计 decay-free schedule;本篇提供其数学内核, 就是那句「等价」的具体形式。
- PMA / LAWA:这些「平均替代退火」的经验结论,在本篇里对应 sliding/EMA 的 形状恰好是一段 WSD;也解释了 PMA 里「等权 vs EMA 差异可忽略」。
- 有限学习率的隐式梯度正则:镜像笔记,步长大小的隐式效应 vs 步长时间分布的隐式效应;同属「训练的离散/工程细节其实在隐式改写优化」这一母题。
- 权重空间几何:本篇的合法性前提(共 basin、无 barrier、river-valley 的 rank-1 结构)都在这张地基图里。
- 模型合并:本篇是「同一次训练轨迹上 checkpoint 平均」这一格的动力学解释;血缘更远的 task expert / RL expert 合并见该图。
- Schedule-Free / The Road Less Scheduled、Anytime Pretraining:本篇给它们「为什么用平均能替代 schedule、又为什么没真正 free」的统一解释。
Sources
- 苏剑林,科学空间博文,kexue.fm/archives/11804(本篇为个人改写 + preliminaries 展开 + EMA/Schedule-Free sense 补充)。
- Defazio, A., et al. The Road Less Scheduled (Schedule-Free). NeurIPS 2024. arXiv:2405.15682。
- Anytime Pretraining. arXiv:2602.03702。
- WSM: Warmup-Stable and Merge — Decay-Free Learning Rate Schedule via Checkpoint Merging. arXiv:2507.17634, 2025(见 checkpoint 平均综述)。