本图谱蒸馏自 从 Checkpoint 平均,到 Task Expert 合并,再到专家蒸馏。Topic 保留叙事,这里只留下当前可复用的判断。
Overview
模型合并研究的是:怎样把多个模型的能力放进一个模型。做法大致两类:在权重空间做线性运算,或在行为/输出分布层面对齐(蒸馏)。
判断能不能合,先看一个问题:这些模型是否还落在同一片可连通的低损失区域里? 这可以按血缘距离展开:
- 同一次训练的 checkpoint(同轨迹,几何最干净)→ averaging
- 同 base 分叉的 task expert(几何还在,被 interference 绷紧)→ task arithmetic / merging
- 生产级 RL expert(几何退化)→ 退出参数空间,蒸馏(合行为不合权重)
血缘越远、后训练越重,权重几何越不可靠,方法也越容易从参数空间退到函数空间。
几何前提:本图依赖的 loss landscape(basin / barrier)、LMC、weight disentanglement、rank-1 子空间、稀疏≠低秩等地基事实,统一见 权重空间几何,此处不重述,只在用到时引用。
Core Concepts
- Task Vector:,微调前后的权重差;可像向量一样加减组合能力(其可加减性奠基于 权重空间几何 的 weight disentanglement)
- 蒸馏(合行为):让专家 rollout 生成数据/logit,在干净 base 上对齐输出分布,绕开参数冲突
- 血缘距离:同轨迹 checkpoint → 同 base task expert → 生产级 RL expert。血缘越远,几何越不可靠
Established Knowledge
前提:合并可行性建立在 共享起点 ⇒ 共 basin 之上(充分非必要——permutation 对齐亦可消 barrier)。以下是合并这一动作本身的已知。
- 权重平均能加速收敛、替代退火;且 LR decay 与 merging 数学等价 — evidence: WSM:学习率衰减与合并等价(SWA → LAWA → Early-WA → PMA → WSM)
- task vector 可加减组合,但必须处理干扰 — evidence: 干扰问题与稀疏化方法(TIES:三步里 Elect Sign 才是关键,单做 Trim 几乎不涨;DARE:随机丢 90%+ 几乎不掉点)
- 退火后的合并轨迹是 rank-1,可从内插走向外推 — evidence: Extra-Merge 与 rank-1 外推(Extra-Merge, ICML 2026;rank-1 性质本身见 weight-geometry)
- 生产级多 RL 专家:合权重掉点,合行为(蒸馏)是当前行业共识 — evidence: 分叉训练与蒸馏回收范式(DeepSeek-V3.2 / Qwen3-Coder / Step 3.5 Flash)。边界:工业报告普遍无隔离 ablation,“蒸馏单独贡献多少”仍是工程经验,不是实证机制
- 多域 RL 专家落在高度重叠的参数子空间、方向趋同(合并是加成) — evidence: M2RL:混训、分叉与几何重叠(M2RL:Jaccard mask 重叠 0.45–0.48 vs 随机 0.18,重叠区 cosine 为正)
- 域交互有结构而非乱打架 — evidence: 同上(Math/Code/Science 推理三域互惠;IF 单向帮推理;Agent 是孤岛——不干扰也不被干扰)
- on-policy 在线蒸馏信号更密、收敛更快、遗忘更少(优于离线) — evidence: 在线蒸馏路线(Nemotron MOPD:AIME25 上 30 步达 92.0 vs GRPO 25 步 91.0)
Active Debates
- RL 是”激发已有能力”还是”注入新能力”?(本领域争议最大的一层)
- 激发:pass@k 增大时 base 反超 RLVR,推理路径原本就在 base 分布里;权重改动小而结构化 — 延展:从”小扰动”到”激发还是注入”(Yue et al., NeurIPS 25 Oral)
- 扩张:够久够稳的 RL(KL 控制 + reference reset + 多样任务)能在 base 怎么采都做不出的题上超越 base — ProRL (NVIDIA)
- status: unresolved。倾向”当前主流的短 RLVR setup 下主要是 sharpen;长稳 RL 能否扩边界仍 open”。分歧主要落在训练时长与 pass@k 度量本身
- 该混训还是该分叉合并?
- 混训够用:M2RL 仅 63.7% 算力混训即追平”分叉 + TIES 最优合并”,分叉价值在工程隔离而非指标
- 分叉必要:M2RL 外部效度存疑——结论建立在 5 个”干净”学术 benchmark 上,真实工业 domain 是大规模强异构高噪声沙箱,那里工程隔离不可替代
- status: leaning「取决于异构性与规模」——干净小域混训够,强异构大规模分叉值
- weight merging vs mix/distill 的本质权衡
- 合权重:主要是继承——增益一致、稳定可预测
- 混训/蒸馏:能涌现单专家没有的新能力,但鲁棒性差(process verification 会崩)
- status: “该混还是该合”没有固定答案,取决于愿意要稳定继承,还是愿意冒鲁棒性风险换涌现
关于 RL 是否稀疏、flat→泛化是否因果 这两个几何层面的争论,见 Active Debates。
Open Questions
- “河”在多大尺度上会弯掉? rank-1 是局部性质,Extra-Merge 增益仅亚个百分点、靠早停兜底;大规模长训练上 PMA 的 decay-skipping 与 Extra-Merge 外推都在押这个赌注,没人系统测过 — related: Update-Anchored Post-Training
- 合权重 vs 合数据的边界究竟在哪? 算力约束、数据可得性、实验隔离需求三者如何决定选择,无干净答案
- 非均匀加权能否搬回单轨迹合并? 主干(SWA→PMA→WSM→Extra-Merge)一律用 uniform SMA,图简单;旁支(贝叶斯搜权、EvoMerge、SoCE 非均匀合并)在 task-vector 场景一直更强。这个正交方向还空着,可能不是增量题
Known Dead Ends
- 直接平均生产级 RL 专家的权重 — why: delta 漂移大、噪声异构,几何前提失效,掉点甚至打坏模型;该转蒸馏
- 对 large-delta 模型用 DARE — why: DARE 硬前提是 delta 足够小(典型纯 SFT ≤~0.002);续训过的大 delta 模型(如 WizardCoder)哪怕只丢 10% 也灾难性崩坏
- LAWA 取 k 过大(>16) — why: 把还在移动的早期权重拉进平均,反而掉点
- 指望 PMA 让模型永久变强 — why: 增益是 Stable 段的阶段性隐式集成,进入 continued training 后基本收敛回 baseline;价值在”训练中段替代退火 + 预测退火质量”
(几何层面的 dead ends,如 flat→泛化非因果、RL 非真稀疏,见 Known Dead Ends。)