一份关于 backprop-free weight-space post-training 的串讲:MeZO、ES 和 RandOpt 都绕开了标准 backward,但它们分别在估计局部方向、更新 search distribution 和直接选择样本。这里先建立统一语言,再解释强 pretrained checkpoint 为什么让随机参数扰动变得有用。| 2026-07
Glossary:先把常用词讲明白
这篇同时用了 optimization、probability 和 LLM post-training 的术语。同一个词偶尔还有多种含义,尤其是 baseline。下面采用本文中的具体含义,不追求覆盖教科书里的所有定义。
目标、分数与模型
| 术语 | 直白解释 | 在本文中的例子 |
|---|---|---|
| Parameter / weight,参数 / 权重 | 模型内部所有可训练数字。把它们排成一个长向量,记为 | 7B 模型的 大约有 70 亿个坐标 |
| Checkpoint | 某一时刻保存下来的完整模型权重 | Qwen2.5-3B-Instruct 是搜索的起点 |
| Pretrained model / base model | 已完成预训练或指令微调、尚未针对当前任务继续适配的模型 | RandOpt 在 base model 附近采样,而不是从随机权重开始 |
| Objective,目标函数 | 算法最终想增大或减小的量。它是一个「输入模型参数,输出单个数」的函数 | 若目标是提高 GSM8K accuracy,就写成 maximize |
| Reward / fitness | 越大越好的 objective value。fitness 是 evolutionary optimization 常用叫法 | 200 道题答对 120 道,reward 可以取 |
| Loss | 通常越小越好。它与 reward 的符号方向相反 | 可以令 ,最大化 reward 等价于最小化 loss |
| Score / metric | 实际评测得到的数字。它可能就是 objective,也可能只是 objective 的 noisy estimate | accuracy、exact match、verifier pass rate |
| Task reward | 针对某个 downstream task 定义的 reward,不是 pretraining loss | 同一个 checkpoint 的 GSM8K reward 与 MBPP reward 是两张不同的局部曲面 |
把 weights 写成一个向量,没有把计算图拉直
更完整的模型记号是 : 固定 residual、branch、attention 与 parameter sharing, 只列出图上所有独立参数的当前取值。数学上可以把这些 tensors
vec + concat成 ;代码通常仍逐 tensor 加噪,candidate reward 则由完整计算图产生。这个坐标化本身没有问题,真正需要审视的是 raw Euclidean distance 与 是否给出了有功能意义的 geometry。详见 参数空间与计算图。
baseline 的三种含义
| 出现场景 | 含义 | 本文如何称呼 |
|---|---|---|
| 「比 base 提升多少」 | 未经当前方法处理的 reference model 或 reference score | base model / base score |
| 「与 PPO、GRPO baselines 比较」 | 实验中的 comparison method | comparison baseline |
| ES 公式里的 | 从所有 rewards 中减去的参考数 ,常取 population mean;它用于降 variance,不是另一个模型 | control-variate baseline |
所以「加入 baseline 」不是再运行一个 baseline model,而是先把每个 candidate 的 reward 做中心化。例如 rewards 为 、 时,权重变成 ;高于平均的 perturbation 被正向加权,低于平均的被反向加权。
采样与概率分布
| 术语 | 直白解释 | 在本文中的例子 |
|---|---|---|
| Random variable,随机变量 | 每次采样可能得到不同值的量 | 扰动向量 |
| Distribution,分布 | 规定「可能采到什么,以及各自多大概率」的规则 | |
| Gaussian / Normal distribution,高斯 / 正态分布 | 钟形分布。靠近均值的数常见,离均值越远越少见 | 每个 weight coordinate 加一个均值为 0 的 Gaussian noise |
| Standard Gaussian,标准高斯 | 均值为 0、方差为 1 的 Gaussian | 中的 是均值, 表示各坐标单位方差且不相关 |
| Isotropic,各向同性 | sampling rule 不偏爱任何方向,每个正交方向的方差相同 | 理论中的 covariance 是 |
| Noise / perturbation,噪声 / 扰动 | 加到 base weights 上的一小段随机变化 | candidate weights 为 |
| ,noise scale | 控制扰动有多大。 越大,candidate 通常离 base 越远 | RandOpt 主实验混合使用 |
| Seed,随机种子 | 用一个整数确定整段 pseudo-random noise;同一 seed 可重建同一 perturbation | 保存 top- seeds 比保存 份完整 checkpoint 便宜 |
| Mean,均值 | distribution 的中心 | ES 更新 Gaussian mean,等于移动下一轮搜索中心 |
| Variance / covariance,方差 / 协方差 | distribution 在每个方向扩散多宽,以及不同方向是否一起变化 | isotropic ES 固定 covariance;CMA-ES 会学习 covariance |
| Probability mass,概率质量 | 某个区域被采中的概率,不是该区域的普通几何体积 | improving region 很大,不代表它在 Gaussian 下的 probability mass 一定大 |
| Local neighborhood,局部邻域 | base checkpoint 周围由 sampling scale 定义的一小片区域 | 「附近」必须连同 和 noise normalization 一起说明 |
| Candidate | 一次采样得到、等待评测的模型变体 | |
| Population | 同一轮所有 candidates 的集合,大小通常记为 | ES-at-Scale 每轮 ;RandOpt 主实验一次采 |
| Positive / improving tail,正向尾部 | reward-change distribution 中少量明显大于 0 的样本 | 大多数 perturbations 普通或变差,但最好的一小批能提高 task score |
| Best-of- | 采 个 candidates 后只看最好的一个 | 它测的是「有限采样能否命中 positive tail」 |
| Top- | 按 score 保留最好的 个 candidates | RandOpt 从 5000 个中保留 50 个 |
| Ensemble / majority vote | 多个模型一起预测,再聚合答案;majority vote 取出现次数最多的离散答案 | RandOpt 的最终产物默认是 50-model ensemble |
梯度、估计与优化过程
| 术语 | 直白解释 | 在本文中的例子 |
|---|---|---|
| Gradient,梯度 | objective 对每个 parameter 的局部斜率组成的向量,告诉我们往哪个无穷小方向变化最快 | |
| Backpropagation / backward | 利用 computation graph 高效算出 sample loss 对全部 parameters 的 gradient | 标准 SFT、PPO、GRPO 都需要 backward |
| Forward pass | 给定 weights 和 input,只计算模型输出,不对参数求导 | MeZO、ES、RandOpt 都能只靠 forward evaluations 获取 score |
| Function query / oracle call | 选一个 ,运行模型与评测器,得到一个 scalar function value | 在 200 道题上跑 candidate 并得到 accuracy,算一次 candidate evaluation |
| Zeroth-order,零阶 | 只能查询 function value,不能直接取得 derivative;「零阶」不等于完全不估计 gradient | MeZO 用两个 function values 构造 gradient estimate |
| Backprop-free | 不运行标准 backward。它是本文最宽的工程分类 | MeZO、ES、RandOpt 都是 backprop-free,但内部逻辑不同 |
| Estimator,估计量 | 用有限 noisy observations 近似一个未知量的公式 | ES 用 rewards 与 perturbations 的相关性估计 smoothed gradient |
| Finite difference,有限差分 | 比较邻近两点的 function values 来近似斜率 | |
| Two-point / antithetic sampling | 沿同一方向同时评测 与 ,两点相减;共享方向能抵消一部分噪声 | MeZO 的默认 estimator |
| Iteration / step / round | 根据本轮 observations 更新中心,然后再采下一轮 | ES 有许多 sequential rounds;原始 RandOpt 只有一轮 |
| Update | 算法改变下一轮 state 的动作,不一定来自真实 gradient | MeZO 更新 parameter point;ES 更新 distribution mean;RandOpt 不做 sequential update |
| Parallelism,并行 | 多个 candidates 同时评测。它能缩短 wall-clock latency,不减少 total work | 5000 个 RandOpt workers 同时跑,仍然消耗 5000 份 evaluation compute |
| Bias,偏差 | estimator 的长期平均与目标真值之间的系统差异 | 太大时,smoothed gradient 可能偏离 raw objective 的局部 gradient |
| Variance,方差 | 重复采样时 estimator 波动多大 | population 太小会让 ES update direction 很抖 |
| SNR,signal-to-noise ratio | 有用方向信号相对随机波动的强弱 | 命中一个好 candidate,不代表 ES 的 aggregate update 已有足够 SNR |
Smoothing 与局部几何
| 术语 | 直白解释 | 在本文中的例子 |
|---|---|---|
| Smoothing,平滑化 | 不直接看 ,而是看 周围许多随机点的平均 reward;尖锐的小波动会被平均掉 | |
| Smoothed objective | 经过上述局部平均后的新 objective。ES 的经典 estimator 对准的是它,不一定是 raw | 改变 会同时改变搜索半径和被优化的 |
| Ambient dimension,表观维度 | parameter vector 一共有多少 coordinates | 7B 模型的 约为 70 亿 |
| Subspace / projection,子空间 / 投影 | 只保留完整 parameter update 在少数方向上的分量 | 把 维 perturbation 压到 个 active coordinates |
| Effective / intrinsic dimension,有效 / 内在维度 | 完成当前任务实际需要的自由度,可能远小于 ;具体定义依论文而异 | objective ID、curvature-active dimension 不能混为同一个量 |
| Curvature,曲率 | gradient 随位置改变得有多快。高曲率方向稍微移动,斜率或 reward 就变化很大 | 少数 stiff directions 可能主导局部 reward change |
| Hessian | scalar objective 对 parameters 的二阶导数矩阵,用来描述各方向的 local curvature;exact Hessian 不保证 PSD | Hessian eigenvectors 给出 signed principal curvature directions |
| Flat / weak direction,平坦 / 弱方向 | 沿该方向小幅移动时 objective 变化很慢 | noise 可能在大量 weak directions 中逐步积累 |
| Stiff / high-curvature direction,刚性 / 高曲率方向 | 沿该方向小幅移动就引起较大 objective change | toy model 中这些 modes 学得快 |
| Tail accessibility | 给定 和 sampling distribution,有限次采样能否碰到足够好的 tail sample | BoD 的 best-of- probe 直接测这个量,而不是直接测 curvature dimension |
用一个小例子串起来
假设有一个 pretrained checkpoint 和 200 道 selection questions。定义 objective 为这 200 题的 accuracy。每次从 standard Gaussian 采一个 ,得到 candidate ,再做 forward evaluations 得到 score 。
- Best-of- 只问 个 candidates 中最好的 score 有多高。
- RandOpt 保留 top- candidates,测试时让它们 majority vote。
- ES 用全体 scores 相对 control-variate baseline 的高低来加权 ,移动下一轮 Gaussian mean。
- MeZO 选同一个方向的 与 ,用两者 loss difference 估计局部 update direction。
四种方法看到的是相似的 function values,用法却不同。后文反复强调的边界也在这里:positive tail 可访问 能直接说明 Best-of- / RandOpt 有机会成功,但不能单独保证 ES estimator 的 SNR 或 MeZO 的多步收敛。
结论先行
- 这不是「RandOpt 一类方法」。 上位概念是 backprop-free weight-space post-training。MeZO 用两次 function query 估计局部方向;ES 用 population reward 估计 Gaussian-smoothed objective 对 search-distribution mean 的梯度;RandOpt 只是其中不估计方向、不更新分布的 sample-select-ensemble 方法。
- 高维并不自动成为 blessing。 对 one-shot selection,关键是指定 checkpoint、noise distribution、reward 和 selection set 下的 improving-tail mass;对 ZO / ES,还要看 estimator variance 与多步 update SNR。参数维度 本身不能回答这些问题。
- 强 pretrained checkpoint 把问题从「全空间学习」改成了「局部选择」。 随机扰动不必从零写入能力,只需在保留原有表示与 circuits 的局部邻域中 reweight、reroute 或 expose 已有行为。这个解释与当前证据相容,但尚未被机制实验坐实。
- 免 backward 主要改变 memory 和并行方式,不等于省总算力。 MeZO 与 ES 不保存标准 backward graph;RandOpt 的一次性采样仍需要 份 candidate evaluation,主实验还要在推理时运行 top- 个模型。 training rounds 依赖海量并行硬件,total work 仍是 。
最稳妥的 mental model 是分三层:
- 经验层:测量局部 reward-change distribution ;
- 算法层:用 selection、reward-weighted averaging 或 finite difference 消费这个分布;
- 机制层:再问 positive tail 来自 gradient、curvature、higher-order structure,还是 evaluation noise。
现有工作对前两层已有证据,对第三层仍以假说为主。
范畴:无反向传播的权重空间后训练
本文的大类只规定两件事:搜索发生在 weight space,算法不通过标准 backward 取得 parameter gradient。它没有规定如何消费 scalar score,也不意味着算法完全不估计方向。可以沿三个轴继续分类:
- 在哪里探索:token/action space,还是 parameter/weight space;
- 如何使用 scalar score:只选 winner、构造 gradient estimator、更新 sampling distribution,还是蒸馏 winner 的 traces;
- 最终产物是什么:一个更新后的模型、一个 population,还是一个需要共同推理的 ensemble。
| 方法 | 如何利用 function value / reward | 是否迭代 | 最终产物 | 主要成本 |
|---|---|---|---|---|
| Plain random search / Best-of- | 从固定分布取最大值 | 否 | 单个 winner | 次 evaluation |
| SPSA / MeZO | 用同一方向的 / 两点差估计局部方向 | 是 | 单模型 | 每方向每步 2 次 forward |
| OpenAI-ES / ES-at-Scale | 用 population reward 加权扰动,移动 Gaussian mean | 是 | 单模型 | 每步 个完整 reward evaluations |
| CMA-ES | 用 elite rankings 学 mean、step size 与 covariance | 是 | 单模型或 population | full covariance 对 LLM 不可承受 |
| RandOpt | 固定 checkpoint 邻域采样,选 top- | 否 | -model ensemble | 一次 candidates,部署时 次 generation |
| Iterative RandOpt | sample-select 后蒸馏,再以 student 为新中心重复 | 是 | 单模型 | 搜索 forward + distillation backward |
| PPO / GRPO | 在 token/action distribution 上做 policy gradient | 是 | 单模型 | rollout + forward/backward |
最容易犯的术语错误
Derivative-free / zeroth-order 不等于 direction-free。 SPSA、MeZO 与常见 ES 都在估计某种 smoothed gradient。原始 RandOpt 才真正不构造 search gradient;它甚至不输出传统意义上的单个「优化后 checkpoint」。
Preliminaries:统一写成一个 black-box 问题
令 是强 pretrained checkpoint,要最大化的 task reward 为
可以包含 prompt、environment randomness 与 decoding randomness。black-box oracle 只返回 noisy scalar ,不返回 。权重空间方法共同使用下面的骨架:
- 从 采样 candidate weights;
- 在一组 inputs 上得到 scalar scores;
- 用 aggregation rule 产生 winner、ensemble 或下一步 。
差别主要在第三步,不在「都加了 random noise」。
Gaussian smoothing:ZO 与 ES 的共同语言
最常见的 search distribution 是
它诱导一个 Gaussian-smoothed objective:
由 Stein / score-function identity,
加入 baseline 不改变期望:
antithetic two-point estimator 则是
在同一个 objective、无限样本与合适正则条件下,两者可以估计同一个 。因此 MeZO 与 ES 并非数学上完全割裂;实际差别来自 finite-sample query design、loss/reward 的定义、population 组织与 state update。
MeZO:用两次 forward 换掉 backward
MeZO 默认每步取一个 Gaussian direction ,在同一 minibatch 上计算
实现用 RNG seed 重建 ,依次 in-place perturb、恢复并 update,不需要保存 activations、gradients、optimizer states 或完整 noise vector。它让单张 A100-80GB 可以 full-parameter tune OPT-30B,而标准 Adam FT 在同一设置只能到 2.7B;代价是通常需要远多于 first-order FT 的 steps。MeZO 的价值首先是 memory accessibility,不是普遍的 wall-clock superiority。
MeZO 的 dimension-free-looking 理论依赖 local Hessian effective rank 较小;论文没有直接测量大型 LM 的该量。prompting 还需要让 fine-tuning objective 与 pretraining landscape 足够接近。这些都是适用条件,不是从模型参数量自动推出的事实。
ES:优化 search distribution 的 mean
NES 从更一般的 search distribution 出发:
若 且只更新 mean ,就回到上面的 Gaussian ZO estimator。ES-at-Scale 是这种 mean-only、fixed-covariance 的简化 ES:每轮采样 个 full-parameter perturbations,用 z-scored rewards 加权所有方向,再移动中心。它不是 top- selection,也没有学习 covariance。
ES-at-Scale 的 Countdown 实验在 Qwen2.5 0.5B 到 7B 与 Llama 1B 到 8B 上用统一的 ;另有 Qwen2.5-Math-7B 与 Qwen2.5-14B 实验。结果说明小 population 的 full-parameter ES 可以实际运行并取得进展,但论文没有测 curvature dimension;「low intrinsic dimension」在原文中只是 future-work explanation。
Best-of-:只关心有没有命中
令一次 perturbation 达到至少 improvement 的概率为
个独立样本至少命中一次的概率为
若希望成功率达到 ,需要
例如 时,约 59 个 samples 才有 95% 概率命中。这个 sample complexity 取决于 tail mass,而不是显式出现的 。这正是 RandOpt 能绕开「准确恢复十亿维 vector」的地方。
但 best-of- 曲线天然有 diminishing returns:Gaussian maximum 只按 增长,accuracy 还受上界限制。因此曲线在 后 flatten,不能反推 active dimension 大约是 30。
找到好方向,比估准完整 gradient 容易
局部一阶近似给出
当 时,。于是任意随机方向变好的概率在纯一阶模型里约为 ,与 无关; 个方向中的最好 improvement 约为
然而单方向 estimator 满足
平均 个方向后,relative RMS error 仍约为 。所以这两件事必须分开:
找到一个 reward-improving candidate 可以几乎不依赖 ;把朴素 estimator 的完整 维 gradient vector 估准,通常仍需要 。
结构性低维假说的作用,是解释为什么无需把 full-space vector 估得很准,也可能在 function space 获得稳定进展;它不是说 vanilla estimator 的向量误差突然消失。
Curvature 不是 positive tail 的唯一来源
局部二阶展开为
Gaussian perturbation 下,
因此 right tail 可能来自一阶 gradient projection、少数 Hessian outliers、higher-order / nonlocal structure,或 finite-prompt evaluation noise。尤其 pretrained point 往往不是 downstream reward 的 stationary point,一阶项可能已经足以解释 tail。仅观察到 positive tail,不能识别「少数 high-curvature directions」这个机制。
Degeneracy:高维 fiber 不等于高概率
假设 reward 真的只依赖一个 维 projection:
此时 ,与 ambient dimension 无关。固定 的 preimage 确实是一个 维 affine fiber,所以有大量 full-space perturbations 共享相同有效投影。但 improving probability 是
真正决定命中率的是 projected improving set 的 Gaussian mass。fiber 维度很大只说明 representation degeneracy,不会自动增加 probability mass;weak curvature、orthogonal gradient 与 higher-order terms 还会破坏「同一 projection 等于同一 reward」。
方法谱系:从 SPSA 到 LLM weight-space search
SPSA、NES 与 OpenAI-ES
SPSA 的关键贡献是用一个 Rademacher direction 的两次 function queries 同时估计全部 coordinates,把 coordinate finite difference 的 queries 降成 2;代价转移到 variance。NES 把目标改写为 search-distribution 的 expected fitness,再对 distribution parameters 做 natural gradient。OpenAI-ES 证明 scalar rewards、shared noise seeds 与大规模并行可以训练较小的 neural policies。
这条经典谱系提供了算法,不足以解释为什么 可以在 billion-parameter LLM 上 work。后者正是 ES-at-Scale 与 BoD 想回答的问题。
MeZO 与 GRZO:two-point ZO 线
MeZO 用 seed replay 把 full-parameter ZO 的 peak memory 压到 inference level。GRZO 再借 Flipout-style sign factorization,在一个 mini-batch 内构造 个伪独立 directions,并用 group-relative normalization 降低 estimator variance;两个 fused forward calls 不等于 次模型调用。
GRZO 当前只验证 classification 与 teacher-forced QA loss,不是 RLVR 或 long-horizon reward 实验;其「GRPO-style」只指 group normalization,不包含 policy ratio、clipping、rollout 或 policy gradient。arXiv v1 也没有给出官方代码仓库。
ES-at-Scale 与 QES:distribution-gradient 线
ES-at-Scale 把 fixed-covariance mean update 直接扩到 full-parameter LLM。QES 则把 ES-style search 搬进 quantized integer lattice:stochastic rounding 产生离散 perturbations,accumulated error feedback 保存小于一个 quantization step 的更新信号,seed replay 避免保存 full-precision residual。
QES 的意义是解决 low-bit search 的「小更新被 round 掉」,不是为 low-dimensional curvature 提供新证据。其 reasoning 配置在论文 v2 中还有 population 口径歧义:正文写 antithetic pairs,超参表写 ,官方脚本则对应 25 pairs / 50 evaluations。复现时应以版本化代码和实际 evaluation count 为准。
Neural Thickets:从更新中心转向保留 population
Neural Thickets 把 pretrained checkpoint 看成一个 local prior 的中心。论文定义 solution density:
它测的是指定 sampling distribution 下的 finite-sample hit rate,不是 coordinate-invariant 的 weight-space volume,也不是 local-minimum density。论文里的「expert」只表示该 benchmark score 更高,不自动意味着新技能、独立 circuit 或真正的 task optimum。

Neural Thickets 的主张与 RandOpt 流程。右侧 指 optimization rounds;总 evaluation work、硬件数与 inference ensemble 成本并没有消失。
RandOpt 到底做了什么
给定 noise-scale set ,原始 RandOpt 的算法只有一次搜索:
- 采样 个 seeds,并为每个 seed 分配一个 ;
- 构造 ;
- 在同一个小 training / validation set 上 greedy evaluate 所有 candidates;
- 选出 top- seeds;
- 对每个 test input,用这 个权重变体各生成一次,再对抽取后的离散答案做 majority vote。
主表的 RandOpt (random) 使用 、、,每个任务取 training set 前 200 条做 selection。模型覆盖 Qwen2.5-Instruct 0.5B 到 3B、OLMo3-7B base/instruct 与 Llama3.1-8B-Instruct;任务以可验证的离散输出为主。ROCStories 实际是五句排序,USPTO-50K 是十类反应分类,不应把它们描述成自由故事生成或 retrosynthesis。
代码用 greedy decoding,因此 population diversity 来自 weight perturbation,而不是每个模型的 decoding randomness。top candidates 可以只存 seed 与 ,需要时重建权重,不必永久存 50 份 checkpoint。
论文直接支持什么
- 在固定 的 Qwen2.5-Instruct 0.5B 到 32B probe 中,matching-or-better fraction 从 0% 增至 64%(GSM8K),从 8% 增至 60%(Countdown)。这是 solution density 随 model scale 增大的直接证据。
- 500 个 perturbations 在 7 个任务上的排名相关性随规模下降,说明 local variants 越来越 task-specific。它不证明同一任务 top- 的 prediction errors 必然互补。
- RandOpt 在 math、code、分类任务与 GQA 上取得明显提升;Qwen2.5-VL-3B-Instruct 的 GQA 从 56.6 增至 69.0。
- 从 scratch 与 GPT-2 0.1B 几乎不工作,0.5B 增益有限,支持「需要足够好的 pretraining」这一边界;它不建立普适的参数量 threshold。
- 已可提升,但多数任务依赖 ensemble 才有竞争力。RandOpt 更像一个被 reward 选择出来的 committee,而不是单 checkpoint optimizer。
- 对主表 42 个 model-task cells 逐项统计,RandOpt 相对 base 是 42/42 提升,相对 的 1-pass 结果是 30/42 胜;但与同为 50-pass inference 的 ES+TT-MV 比较时只有 15 胜、1 平、26 负。最稳结论是「random search + ensemble 普遍改善 base,并对 1-pass RL 有竞争力」,不是「胜过 iterative ES」。
MBPP 的发布实现把官方 train、validation、test 拼接后再按前 200 / 其余切分,MATH-500 也使用前 200 / 后 300 的非标准划分。它们没有 selection-test overlap,但数值不适合与标准 leaderboard 直接横比。ROCStories 的 ensemble 代码还把非零 partial score 当作整题正确,而 raw-model path 曾按 partial score 求平均,两条评估路径并非同一 metric;该列尤其不宜解释成 creative-writing 能力。
一部分 gain 是 reasoning,另一部分只是 format

GSM8K / Qwen2.5-3B-Instruct 的行为拆分。RandOpt 达到 86.7%,其中 12.3% 的问题由错误 reasoning 变成正确,19.0% 只修正了 answer format;相对 base-correct cases 的 regression 为 0.7%。top-1 的 regression 是 14.7%,说明 ensemble 的主要作用之一是抵消 individual perturbation 的回退。
这张图支持「邻域中确实有 reasoning-improving variants」,也暴露了 verifier sensitivity。它没有定位对应 circuit,更没有证明 format 与 reasoning 来自同一低维 curvature subspace。
真实工程账本
| 维度 | RandOpt 的实际含义 |
|---|---|
| Adaptive depth | 1 次 selection round;无 sequential parameter update |
| Total training work | 个 candidate-prompt evaluations,主表约 |
| Wall-clock | 只有在大量 workers 同时存在时才接近一次 evaluation;论文的 3.2 min showcase 使用 200 张 GH200、,约为 10.7 GH200-hours,未报告 utilization |
| Communication | workers 只需回传 seeds、 与 scalar scores |
| Stored state | base checkpoint + top- seeds 即可重建 |
| Inference | 主结果每个 input 需要 次 generation |
| Output | 一个 ensemble; 或 distillation 后才是单模型 |
「same training FLOPs」也需要谨慎。论文按 forward 约 、backward 额外约 估算,但把附录表的超参数代回其公式,RandOpt、ES、GRPO、PPO 分别约为 2.000M、2.004M、13.107M、1.075M ,并不相等;ES 还同时出现 与 两种口径。即便只接受作者的归一化,headline 也没有把 RandOpt 的 test-time generation 纳入同一个 system budget。更可靠的报告应同时列出 training FLOPs、sequential depth、hardware count、GPU-hours 与 amortized inference cost。
selection overfitting 也不能忽略:5000 个 candidates 都在同一组 200 条 training examples 上排名,虽然最终在 test split 汇报,但论文没有用 fresh prompts 重评 finalists,也没有分析 增大时 winner’s curse。若 observed score 为 ,即使所有真实 相同,Gaussian evaluation noise 的 selected maximum 也会约虚高 。
发布代码还留下两个会影响几何解释的实现问题。其一,noise worker 对每个 parameter tensor 都用同一 seed 重新初始化 generator,不同层会复用 Gaussian sequence 的前缀,实际 covariance 未必是论文写的 full-vector i.i.d. 。其二,代码在 bf16 weights 上原位加噪再减噪恢复,加减不严格可逆,长序列 candidate evaluation 可能产生 drift 和 order dependence;论文没有报告对应检查。
Distillation 与 Iterative RandOpt
Neural Thickets 用 top-50 teachers 产生约 25K traces,再做两轮 distillation,把 的推理开销压回单模型。GSM8K 上,Qwen2.5-1.5B 从 ensemble 76.4% 降到 distilled 74.9%,3B 从 87.1% 降到 84.3%;作者估计 distillation 约增加原 search 2% 的 training compute。
2026-07 的官方 Iterative RandOpt blog 再把这一步做成循环:
其 OLMo-3-7B / GSM8K demo 在四轮后得到单模型 92.87%,matched-FLOP ES 略低于 89%。这是官方 blog 的新结果,不是 Neural Thickets 论文的 peer-reviewed evidence。distillation 阶段仍用 supervised per-token loss 和 backward,因此 Iterative RandOpt 整体不再是纯 backprop-free 方法。
如何读「四句话压缩」
下面逐句保留原 insight,再标注 grounding。
1. 「LLM 参数空间虽然极高维,但微调奖励可能主要由少数高曲率方向控制。」
状态:合理的机制假说,不是当前实验已证事实。
BoD 的 best-of- probe 直接测到的是 improving tail 在 Qwen2.5 0.5B 到 7B 上没有随规模系统消失;Appendix 的 curvature proxy 定义和 normalization 不完整。MeZO 假设 low effective rank,ES-at-Scale 只把 low intrinsic dimension 写成 future work,Neural Thickets 完全没有测 Hessian。还必须保留一阶 gradient 足以解释 tail 这个 alternative。
2. 「这些方向学习得快,而大量平坦方向中的噪声积累得慢,因此训练奖励可能呈现先上升、后下降的非单调变化。」
状态:quadratic additive-noise model 中的 sufficient mechanism,真实训练中的因果性未识别。
该机制还要求特定 initialization、mixed-sign amplitudes、不同 relaxation rates 与足够高的 noise floor。exactly flat modes 是 random walk,并没有 finite stationary variance。真实 ES / GRPO 是否满足局部 quadratic、state-independent isotropic noise 与 single-basin 假设,论文没有验证;详见 BoD 的数学审计。
3. 「高维参数空间中的有效更新并不是唯一的,而是存在大量在关键低维子空间中具有相似投影的扰动方向。」
状态:在 projection-only assumption 下数学成立。
维 fibers 说明同一 effective projection 有很多 full-space representatives,但不说明 success probability 随 增大。命中率仍由 projected improving set 的 Gaussian mass 决定。若 orthogonal gradient、weak-but-nonzero curvature 或 higher-order terms 不可忽略,「相似投影」也不再保证相似 reward。
4. 「因此,ES 不需要准确恢复完整的十亿维梯度,只需要通过少量随机采样命中奖励变化分布中的正向尾部。」
状态:前半句是好 intuition;后半句对 RandOpt 直接成立,对 ES 不充分。
RandOpt 只需要 top- 中出现好样本。ES-at-Scale 的实际 update 使用全部 z-scored rewards,负 reward directions 也以负权重参与;它需要 population 中 reward 与 perturbation 的相关性形成足够 SNR。one-step tail accessibility 不保证 reward-weighted estimator 的多步稳定性。
更严谨的四句话版本
- 大模型 checkpoint 周围的 task-reward distribution 可能由少数 active directions 主导,但现有实验直接测到的是 improving tail,而不是 active dimension。
- 异质 curvature 与持续 update noise 在 quadratic model 中足以产生 rise-then-decay;真实训练是否由此导致仍待 causal test。
- 若 reward 主要依赖低维 projection,同一有效投影对应大量 full-space perturbations;这种 degeneracy 让 ambient dimension 不必成为 curse,却不会自动提高命中率。
- RandOpt 可以用 best-of- 直接利用 positive tail;ES 也可能用低精度 search gradient 前进,但还需要 reward-weighted aggregate 具有足够 SNR。
BoD、ES-at-Scale 与 Neural Thickets 各自补了什么
| 工作 | 直接测量 | 能支持的 claim | 不能支持的 claim |
|---|---|---|---|
| ES-at-Scale | 小 population 的多步 full-parameter ES 结果 | 在所测 LLM/reward 上可以训练 | 原因一定是 low curvature dimension |
| BoD | Qwen2.5 0.5B 到 7B 的 one-step best-of- tail;toy dynamics | 所测尺度内 tail accessibility 未系统恶化;rise-decay 有一个简单充分机制 | 等于 active dimension;tail 已证明来自 top-curvature projection |
| Neural Thickets / RandOpt | Qwen2.5 0.5B 到 32B solution density、跨任务 diversity、end-to-end ensemble | 强 checkpoint 邻域确有可被选择的 task-improving variants | 这些 variants 是 local minima、新技能或独立 circuits |
三者合起来形成一条合理证据链:训练现象存在 → 局部 tail 可接触 → selection 本身可以变成算法。 尚未闭合的是「tail 为什么存在」与「它为什么随 scale 变密」的因果链。
强 pretrained checkpoint 为什么改变问题
从 scratch training 是在巨大空间中构造复杂 function;RandOpt 是以 为中心,在 task-conditioned local prior
中挑选 behavioral variants。pretraining 可能带来已有 representations、circuits 与 latent skills;overparameterization 和 symmetry 可能提供近等价参数化;小 还保留 general competence。于是小参数扰动只需 reroute 或 reweight,不必从零编码能力。
这里有两个重要边界:
- aggregate pretraining loss 看起来 flat,不妨碍 per-task reward surfaces 在同一位置很 spiky;RandOpt 消费的是后者。
- one-shot local selection 更擅长 elicitation / sharpening。新知识注入、强 domain shift 或需要多步累积改变的任务,可能必须离开 local thicket;这时 MeZO、ES、RL 或 gradient FT 更合适。
它与 内在维度、权重空间几何 相邻,但不能混成同一概念:objective intrinsic dimension、curvature-active dimension、update rank 与 improving-tail probability 分别回答不同问题。
什么时候选哪种方法
| 条件 | 更合适的起点 | 主要风险 |
|---|---|---|
| differentiable supervised loss,显存是主要瓶颈 | MeZO / ZO-PEFT | steps 多、directional variance 高,未必更快 |
| reward 不可微或由完整 trajectory 定义,需要单 checkpoint | ES-at-Scale 类 mean update | 每轮 population rollout 贵,多步 SNR 未必稳定 |
| 有极大并行资源、小 selection set、离散可投票答案,ensemble 可接受 | RandOpt | 次 search 与 次 inference;selection overfitting |
| 需要单模型部署,但相信局部 population 有用 | RandOpt + distillation | 第二阶段重新引入 backward;teacher errors 会被固化 |
| 必须在 INT4 / INT8 lattice 内直接搜索 | QES | discrete estimator 理论弱、replay 与 population 口径需复核 |
| two-point ZO 的主要问题是 minibatch variance | GRZO 类 structured directions | 当前证据集中在分类/teacher-forced loss,非 RLVR |
| 需要学习 sampling geometry | diagonal / layerwise / low-rank ES 或 trajectory-guided sampling | full CMA covariance 是 ,对 LLM 不现实 |
最有信息量的下一步实验
- 识别 tail 的来源。 估计 reward Hessian top subspace,比较 top-subspace、orthogonal-complement 与 isotropic perturbations。若 orthogonal tail 同样强,high-curvature explanation 会被直接削弱。
- 修正 scale confound。 标准 Gaussian 满足 ;跨模型固定 per-coordinate 并非固定 radius。应并列 fixed-、layer-relative、weight-norm normalized 与 fixed logit-displacement noise。若 scaling trend 消失,所谓 blessing 主要是 parameterization artifact。
- 控制 winner’s curse。 selection split 排名,fresh prompts / generation seeds 重评 finalists,最后只在 held-out test 汇报; 越大,validation evidence 也应增加。
- 区分 latent elicitation 与 new-skill learning。 设计 base model 在大 sampling 下仍失败、且需要新知识或新 algorithm 的任务,扫描 search radius 与 sequential rounds。若 local RandOpt 仍成功,才构成更强的 capability-expansion 证据。
- 学习 structured covariance。 用训练轨迹、短 probe 或 HVP 估计低秩 / layerwise sampling directions。这与 Update-Anchored Post-Training 的 Constrained Parameter Sampling 直接相接;关键 baseline 是相同 trace 与 compute 下的 isotropic、random low-rank 和 learned low-rank noise。
- 把 committee 收回单模型。 比较 weight averaging、logit distillation、trace distillation 与 iterative search,跟踪 pass@1、pass@、旧任务保持率和 calibration,而不只看最终 accuracy。
- 把 system budget 对齐。 同时报告 training FLOPs、GPU-hours、hardware count、adaptive depth、selection data 与 amortized test-time compute;否则 one-step parallelism 与 sequential training 很难公平比较。
与现有知识库的连接
- BoD:本笔记的理论动机与四句 insight 来源;该 paper note 已对 rise-then-decay、tail probe 和 curvature proxy 做逐式审计。
- 内在维度:区分 representation/data ID、objective/parameter ID 与这里的 curvature/tail notions。
- 权重空间几何:RandOpt 应放进「task-conditioned local reward geometry」分支,不能从 pretraining-loss flatness 直接推出。
- 从 Checkpoint 平均,到 Task Expert 合并,再到专家蒸馏:把 RandOpt 放在「能力在 pretrained neighborhood 中可被采样」的更大后训练图景里。
- Update-Anchored Post-Training:把 isotropic RandOpt 推广为 trajectory / probe direction 引导的 structured sampling。
建议给 权重空间几何 后续补一条待验证分支:reward-defined stochastic geometry,包括 solution density、tail accessibility、curvature-active subspace 与 sampling-distribution dependence。当前不应把它写进 stable mental model,因为 causal alignment test 仍缺失。
Primary sources
- SPSA (1992)
- Natural Evolution Strategies / NES (2014)
- CMA-ES Tutorial (2016)
- OpenAI-ES (2017)
- MeZO (2023) | code
- ES-at-Scale (2025) | code
- BoD (2026)
- QES (2026) | code
- Neural Thickets / RandOpt (2026) | project | code
- GRZO (2026)(arXiv v1 未给官方代码)
- Iterative RandOpt (2026-07, official blog)
Research log
- 2026-07-10:以 SPSA、NES、OpenAI-ES、MeZO、ES-at-Scale、QES、Neural Thickets、GRZO 与 Iterative RandOpt 的 primary sources 建立谱系;未找到专门覆盖「LLM full-parameter ZO + ES + RandOpt」的 canonical survey,因此没有用二手综述代替原文。
- 直接证据:Neural Thickets 的 solution density / behavior decomposition;BoD 的 one-step tail probe;ES-at-Scale 的多步 training curves;MeZO / GRZO / QES 的各自 implementation results。
- 机制假说:low curvature-active dimension、projection degeneracy、pretraining-induced thicket;当前没有一篇工作同时测量 active subspace、tail projection 与 multi-step update SNR。
- 复现风险:Neural Thickets 的 compute normalization 与 ES hyperparameters 存在口径矛盾;官方 RandOpt 实现按 parameter tensor 重置同一 RNG seed,实际 noise covariance 未必等于论文写的 full-vector i.i.d. ;QES 的 population 配置也有版本歧义。