Summary
Sparsity Curse: Understanding RLVR Model Parameter Space from Model Merging
- 核心: RLVR 模型的更新稀疏且 off-principal,导致独立训练的 RLVR 模型在参数空间里彼此近正交、互不兼容——合并不仅不增益反而严重退化(“sparsity curse”),与 SFT 模型”共 basin、合即增”形成鲜明对比。
- 方法: SAR-Merging——冲突区用 Fisher Information 做敏感度仲裁(保留更敏感模型的更新),private 区做 magnitude-aware DARE 稀疏化 + rescaling,保护脆弱的 reasoning 通路。
- 结果: 在 1.5B/7B 数学与代码 RLVR 模型上显著优于 Linear/Task Arithmetic/TIES/DARE/RAM;但合并模型仍普遍打不过更强的单个 parent。
- Sources: paper
- Rating: 2 - Frontier — RLVR × 模型合并交叉点的早期探针,现象刻画(正交 shortcut、激活几何)有价值,但方法为已有组件拼装且未突破”打不过 best parent”的天花板。
Key Takeaways:
- Sparsity curse: RLVR 的稀疏更新不是合并的福音而是诅咒——稀疏意味着两个模型的更新散落在参数空间各处、几乎正交,naive 平均把模型推进低密度的 saddle/transition 区。
- RL ≠ SFT 的优化 regime: SFT 收敛到共享的、平坦的 basin(layer-wise 更新余弦相似度高、激活景观连成 ridge);RLVR 各自找一条随机的正交 shortcut(更新近正交、激活景观是孤立尖峰)。
- Fisher 敏感度仲裁是主要功臣: ablation 显示三个组件里,sensitivity-based conflict resolution 贡献最大——sign voting 那套对 RLVR 失效,因为它的稀疏更新对应 task-specific 的推理捷径。
- 诚实的天花板: 即便 SAR-Merging 把退化压到很小,merged RLVR 仍打不过更强的 parent——“真正的 reasoning aggregation”仍是 open problem。
Teaser. 合并两个 7B 模型(GSM8K):SFT 怎么合都涨,RLVR 怎么合都跌。 红色为相对 naive average 的增益/下降——所有经典合并方法(Linear / Task Arithmetic / TIES / DARE)作用在两个 RLVR 模型上时一律低于 naive average,而同样的方法作用在两个(本身精度并不高的)SFT 模型上却一律带来提升。这张图是全文的出发点。

1. 问题:稀疏更新到底利不利于合并?
近期工作(The Path Not Taken、RL finetunes small subnetworks)发现 RLVR 与 SFT 处于根本不同的优化 regime:SFT 沿权重矩阵的 principal singular 方向更新,RLVR 则是稀疏(sparse)且 off-principal,只在低曲率子空间里改动极小一部分参数、保留预训练的谱结构。
这自然引出一个假设:既然 RLVR 更新这么稀疏,两个模型改的参数几乎不重叠,那它们应该更容易合并(互不干扰)才对。本文的回答是反直觉的 “恰恰相反”——并把这个失败命名为 sparsity curse:稀疏的、off-principal 的更新在参数空间里散得很开、近乎正交,形成各自的”捷径”,使聚合天然脆弱。作者推测这源于 RL 优化的随机性 + 涌现推理模式的多样性。
❓ 这里的因果链值得追问:是”稀疏 ⇒ 正交 ⇒ 不可合”,还是”正交”本身才是病根而稀疏只是伴随现象?后文 Fig 3 直接测了正交性,但稀疏与正交谁是因谁是果,论文用的是”likely stems from”,属于推测而非证据。
Table 1. RLVR 的更新稀疏度远高于 SFT(bf16,阈值 )
Sparsity = 未被更新参数的占比(1 − 更新比例)。同一 base 下,SFT 改动相对密集,RLVR(GRPO/DRPO/GPG)普遍 70%+ 稀疏。
| Base | FT Model | Algo | Sparsity |
|---|---|---|---|
| DS-R1-Distill-Qwen-1.5B | lul-SFT | SFT | 12.06% |
| DS-R1-Distill-Qwen-1.5B | MiniMath | SFT | 60.39% |
| DS-R1-Distill-Qwen-1.5B | DeepScaleR-1.5B | GRPO | 77.36% |
| DS-R1-Distill-Qwen-1.5B | E1-Math-1.5B | GRPO | 75.74% |
| Qwen2.5-Math-7B | Aryabhata-1.0 | SFT | 3.2% |
| Qwen2.5-Math-7B | Satori-SFT-7B | SFT | 21.84% |
| Qwen2.5-Math-7B | Qwen-2.5-7B-MATH-RL | GRPO | 85.70% |
| Qwen2.5-Math-7B | Qwen2.5-Math-7B-Oat-Zero | DRPO | 76.70% |
❓ 阈值 在 bf16 下接近机器精度量级,“是否被更新”的判定对阈值敏感;SFT 行内部从 3% 到 60% 的巨大跨度也说明”SFT 一定密集”并不绝对(MiniMath 60% 稀疏度已逼近 RLVR)。这张表支撑”RLVR 通常更稀疏”,但不支撑”稀疏度能干净地区分 RL/SFT”。
2. 实证分析:RLVR 的更新几何为什么不可合
2.1 观察:经典方法在 RLVR 上一律退化
在 GSM8K 上合并两个 7B RL 模型与两个 SFT 模型(Fig 1):SFT 双亲本身精度不高,但任意合并策略都能显著提升;RL 双亲各自表现好,任意合并都掉点。于是作者从多个角度解剖 RLVR 的更新结构。
2.2 Layer-wise 稀疏度与正交性
逐层稀疏度(Fig 2):RL 与 SFT 的更新都集中在中间层,token embedding / normalization 层几乎不动。关键差异在 output head——SFT 为了 label 监督会显著更新 head,RLVR 几乎不动 head。中间层的更新幅度对层深相对稳定。
Figure 2. 7B RLVR(左)vs SFT(右)的逐层更新稀疏度剖面。
逐层更新相似度(Fig 3):测两个独立 RL 模型在每一层的更新余弦相似度——结果几乎全部正交。即不同 RL 模型在参数空间里随机各找一条捷径,而非像 SFT 那样沿共享的 principal 方向收敛。这与”RL 通过让不同输入激活不同功能子路径来增加 activation diversity”的发现一致:独立 RL 模型为同一任务强化了不同的正交 circuit shortcut。这是全文最硬的证据,也是 sparsity curse 的直接机制。
Figure 3. 两个 RL 模型逐层权重更新的余弦相似度(左 1.5B:DeepScaleR vs RLinf-math;右 7B:MATH-RL vs Oat-Zero)。近乎全正交。
训练动力学(Fig 4):用 EvoLM 的 1B/4B checkpoint 跟踪 PPO 训练中稀疏度的演化——随训练推进,稀疏度逐渐下降(RL 不断扩大更新足迹),但精度非单调、来回波动,与”RL 在探索多条捷径而非沿单一优化路径前进”一致。
Figure 4. PPO 训练中 RLVR 模型的更新稀疏度(降)与精度(波动)—— 1B(左)/ 4B(右),来自 EvoLM checkpoint。
2.3 激活密度景观:合并为何把模型推出 basin
在固定下游任务(GSM8K)上收集双亲与平均合并模型在某固定 transformer 层的隐激活,PCA 投到 2D(PC1/PC2 解释 45.28% / 21.29% 方差),再对池化后的联合激活做 KDE 估计联合密度 ,并用每个模型激活中心附近的局部曲率 刻画几何。
- SFT(Fig 5c/d):宽而连通的激活景观,双亲虽沿 PC2 分居但被一条平滑高密度带连接,merged 模型落在这条带之间而非低密度沟里;三者局部曲率均为负(concave,),merged 仍在被良好支撑的凹区内。⇒ 参数平均能把 merged SFT 放进 in-distribution 的激活区,这解释了为何 SFT 直接合并常常有效。
- RLVR(Fig 5a/b):狭窄而脆弱的几何,激活沿一条细对角带聚集,密度面在偏离窄支撑后骤降;曲率高度不对称——RLVR Model 1 在尖锐凹峰(),但 merged RLVR 的曲率为正(),落入 saddle/locally-convex 的过渡区。⇒ 即便 2D 投影里双亲与 merged 看着很近,RLVR 的共享激活支撑更尖、对插值更不容忍,naive 平均会把模型推离稳定 basin。
Figure 5. 1.5B RL(a/b)与 SFT(c/d)的激活密度景观(2D 等高线 + 3D 曲面)。RL 是孤立尖峰 + 骤变;SFT 是跨双亲与 merged 连通的平滑 ridge。
❓ 这套”激活密度 + 局部曲率”分析很漂亮,但样本量小(单层、单任务、各 regime 仅 2 个 parent + 1 merged),曲率正负的结论建立在个位数模型点上,更像是 illustrative 而非统计意义上的证据。把”merged 曲率为正”上升为 RLVR 的一般性质需谨慎。
3. 方法:SAR-Merging
观察总结出两个挑战:① 稀疏更新在聚合时产生不同性质的重叠区,各需不同处理;② 独立 RLVR 学到近正交方向。SAR-Merging 对症下两味药——冲突区敏感度仲裁 + 稀疏保持的 rescaling。
3.1 参数区域划分(Fig 6)
设两个 task vector 、,按每个参数的更新状态把空间分为四区:
- Conflict :两模型都更新但方向相反
- Overlap(非冲突):
- Private:只有一个模型更新
- Unchanged:都没更新

Figure 6. 稀疏 RLVR 合并的”区域视角”:overlap / private / unchanged,overlap 内含符号冲突子空间。
3.2 敏感度量化(Fisher)
在冲突区用一个小验证集 (如 GSM8K 的一部分)算对角 Fisher Information 作为敏感度向量 :
大 ⇒ 扰动该参数对模型 输出分布影响大 ⇒ 任务敏感度高。它给出冲突区”该保留谁的更新”的局部判据。
3.3 冲突解决:敏感度仲裁
非冲突直接相加;冲突处保留敏感度更高那一方,等于”沉默掉更不自信的更新”:
这一步是 TIES 的 sign-voting 的替代:作者发现 sign voting 对 RLVR 失效(稀疏更新对应 task-specific 捷径,简单投票会误杀),改用 Fisher 仲裁。
3.4 稀疏化与 rescaling(DARE-style)
对 private 区中幅值较低的那一半做 DARE 式随机稀疏化(只 drop 低幅值半区,因其更可能是弱/噪声更新),mask ,再 rescale 补偿期望收缩:
rescale 因子 保持稀疏化后的期望幅值不变(,乘回去即复原)。对 RLVR 用比 SFT 更小的 dropout(1.5B 用 0.2),以免破坏稀疏推理路径。
4. 实验
设置:数学 GSM8K / MATH,代码 HumanEval / MBPP;1.5B 基于 DeepSeek-R1-Distill-Qwen-1.5B、7B 基于 Qwen2.5-Math-7B。Baselines:Linear / Task Arithmetic / TIES / DARE / RAM-Merging。RTX 5090。
4.1 主结果(数学)
- 1.5B(Table 2):多数 baseline 在更难的 MATH 上明显低于 naive average。SAR-Merging 在三组 RL 配对上全面最优:RL1&RL2 把 GSM8K 从 naive avg 62.88% 提到 68.34%,MATH 达 58.70%(baseline 仅 47.34–50.52%)。
- 7B(Table 3):更难。多数方法在 GSM8K/MATH 都显著低于 naive avg;SAR-Merging 做到 GSM8K 86.59%(退化仅 −2.48%)、MATH 70.78%(−5.52%);在 RL1&RL3 上是唯一超过 naive avg 的方法(GSM8K 87.31%,+1.53%)。
- 冲突率与难度正相关:冲突率越高越难合——1.5B 的 RL1&RL3 冲突率仅 0.56%、是唯一两数据集都超 naive avg 的配对;冲突率 6–7% 的配对仍有残余 MATH 退化。
4.2 多能力融合(数学 + 代码,Table 4)
即便冲突率极低(1.92%),传统方法在代码任务上崩得最狠:Linear 把 HumanEval 从 parent 的 36.58% 砸到 15.24%,DARE 9.75%,RAM 14.63%——几乎摧毁编程能力。SAR-Merging 显著更能保住多任务能力(GSM8K 仍 58.06%)。作者推测代码生成对参数极其敏感,平均/剪枝易破坏代码逻辑所需的稀疏激活路径。
4.3 Ablation(Table 5,7B RL1&RL2)
三个组件都正贡献,sensitivity-based conflict resolution 最关键(去掉它 MATH 从 70.78 掉到 63.52,是最大跌幅)。从几何看,高敏感度参数对应 loss landscape 高曲率方向,不保护就会把 merged 推进高 loss 区。
| Sensitivity | Sparsification | Rescaling | GSM8K | MATH |
|---|---|---|---|---|
| ✓ | ✓ | − | 85.31% | 68.42% |
| ✓ | − | ✓ | 84.76% | 67.84% |
| − | ✓ | ✓ | 82.94% | 63.52% |
| ✓ | ✓ | ✓ | 86.59% | 70.78% |
关联工作
基于
- The Path Not Taken / RL finetunes small subnetworks: 本文的前提——RLVR 更新稀疏、off-principal、只动小子网。本文把这个”性质”接到”合并”这个下游问题上。见 稀疏化方法谱系。
- DARE: §3.4 的稀疏化 + rescaling 直接借用(drop low-magnitude + 补偿)。
- TIES-Merging: 提供”sign 冲突”框架,但本文用 Fisher 仲裁替换其 sign voting。
- Task Arithmetic: task vector 的基础抽象。
- Fisher-weighted Averaging: 用 Fisher Information 指导合并的思想来源,本文将其局部化到冲突区做 element-wise 仲裁。
- Model Soups: Linear averaging baseline。
对比
- RAM-Merging: 首个考虑 RL(agent)模型合并,但其 agent 模型更新稀疏度低、更像 SFT,不能推广到高稀疏 RLVR——本文正是补这个 gap,也作为 baseline。
- 经典 SFT-向合并方法(Linear / Task Arithmetic / TIES / DARE)在 RLVR 上一律退化,是本文的反衬。
方法相关
- AIM / ACM: 利用激活空间统计/互信息指导合并,与本文 §2.3 的激活几何分析同源但目标不同。
- 共享 basin / LMC: SFT”共起点 ⇒ 共 basin ⇒ 可线性合并”的几何前提,本文证明 RLVR 打破了它。见 权重空间几何 与 模型合并。
- 对我的研究:这条”RLVR 各自找正交 shortcut”的证据,与 Update-Anchored Post-Training 关心的”如何锚定/约束 post-training 更新方向”直接相关——若能在训练时就让多个 RLVR run 朝共享子空间收敛,合并难度可能从根上降低。
论文点评
Strengths
- 问对了问题:把”RLVR 稀疏”从一个孤立观察,连到”可合并性”这个有实用价值的下游问题,并给出反直觉答案。problem formulation 比方法本身更有信息量。
- 多角度证据链:稀疏度(Table 1)→ 逐层正交性(Fig 3)→ 训练动力学(Fig 4)→ 激活密度几何(Fig 5),从参数空间和激活空间双向刻画失败机制,比”提个方法刷点”扎实。Fig 3 的近正交性是最硬的一击。
- 诚实的 limitation:明确承认 merged RLVR 打不过更强 parent,没有把”减小退化”包装成”reasoning aggregation”。符合”negative result 同等重要”。
- 可落地的工程组合:Fisher 仲裁 + DARE rescaling 都是已验证组件,易复现、无需训练。
Weaknesses
- 方法是已有组件拼装:Fisher(来自 Fisher Merging)+ sign 区分(TIES)+ DARE rescaling,novelty 主要在”用对地方”而非新机制。simple 是优点,但也意味着 insight 密度集中在分析部分而非方法。
- 没真正解决 sparsity curse:既然根因是”正交 shortcut + 脆弱激活几何”,元素级仲裁只是在既定正交结构里挑边,并未让模型走向共享 basin——所以打不过 best parent 是必然,而非偶然。真正的解可能要回到训练时(共享子空间约束)。
- 几何证据样本量小:§2.3 的曲率结论建立在每 regime 2 parent + 1 merged 的个位数点上,单层单任务,更像 illustrative。“merged RLVR 曲率为正”被当作一般性质有 overclaim 风险。
- 稀疏度阈值与 regime 边界模糊:Table 1 里 SFT 的 MiniMath 已 60% 稀疏、逼近 RLVR,说明”稀疏度”并不能干净区分 RL/SFT,“sparsity curse”的命名可能把伴随现象(稀疏)当成了主因(正交 + 随机性)。
- 仅 pairwise、仅 Qwen/DeepSeek 系:未验证 ≥3 模型合并、Llama 系、14B/70B。
可信评估
Artifact 可获取性
- 代码: 未开源(未检索到官方 repo / project page)
- 模型权重: 未发布合并产物;但所有 parent 均为公开 HF checkpoint(Table 1 列全,含 DeepScaleR / RLinf-math / E1-Math / Oat-Zero 等),可复现性较好
- 训练细节: 仅合并超参(DARE dropout 1.5B 0.2 / 7B 0.9;RAM ;本方法 dropout 0.2;阈值 ;bf16);Fisher 验证集”GSM8K 的一部分”未给具体规模
- 数据集: 全开源(GSM8K / MATH / HumanEval / MBPP)
Claim 可验证性
- 可信:RLVR 更新比 SFT 稀疏:Table 1 多模型实测,grounding 扎实(但要看阈值依赖)。
- 可信:独立 RLVR 模型更新近正交:Fig 3 逐层余弦相似度直接测量,是最强证据。
- 可信:SAR-Merging 优于 baselines 且减小退化:Table 2/3/4 多设置一致。
- 可信:merged 打不过 best parent:作者在 Limitation 主动承认。
- 存疑:“merged RLVR 落入 saddle/convex 过渡区(曲率为正)“是 RLVR 一般性质:样本量过小、单层单任务,属 illustrative 而非统计证据。
- 存疑:“sparsity curse”命名暗示稀疏是病因:证据更支持”正交 + RL 随机性”为主因,稀疏更像伴随;归因略松。
Notes
- 最有复利的一条:“独立 RLVR run 各自强化不同的正交 circuit shortcut”。若成立,它对 RLVR 的 ensembling / 多 run 聚合 / self-consistency 都有含义——正交意味着 diversity 高(可能利于 ensemble),但也意味着 weight-space 不可合(只能 output-space 聚合)。这与”RL 增加 activation diversity”的线索一致。
- 反过来给 Update-Anchored Post-Training 一个动机:若在 RLVR 训练时加共享子空间/锚定约束,把”随机正交捷径”拉回”共享方向”,是否能让 RLVR 也像 SFT 一样”合即增”?这是比 post-hoc 仲裁更根上的解法。
Rating
Metrics (as of 2026-06-29): citation=0, influential=0 (N/A%), velocity=0.0/mo(发布仅 ~0.4 月); HF upvotes=N/A(HF 无该 paper 页); github=N/A(未检索到官方代码仓库)
分数:2 - Frontier 理由:处在 Eric 正在主动绘制的 RLVR × 模型合并 / 权重几何交叉点上(直接喂 模型合并 与 权重空间几何 两张图),现象刻画(近正交 shortcut、激活几何脆弱)是有价值的 frontier 数据点。但不上 3:方法为已有组件拼装、未突破”打不过 best parent”的天花板,几何证据样本量小且”sparsity curse”归因偏松;发布 <1 月、0 citation 属正常,按 early-signal 看尚无 influential citation / star 增速支撑。综合落在”重要参考但非奠基”的 Frontier 档。