一份关于 backprop-free weight-space post-training 的串讲:MeZO、ES 和 RandOpt 都绕开了标准 backward,但它们分别在估计局部方向、更新 search distribution 和直接选择样本。这里先建立统一语言,再解释强 pretrained checkpoint 为什么让随机参数扰动变得有用。| 2026-07

Glossary:先把常用词讲明白

这篇同时用了 optimization、probability 和 LLM post-training 的术语。同一个词偶尔还有多种含义,尤其是 baseline。下面采用本文中的具体含义,不追求覆盖教科书里的所有定义。

目标、分数与模型

术语直白解释在本文中的例子
Parameter / weight,参数 / 权重模型内部所有可训练数字。把它们排成一个长向量,记为 7B 模型的 大约有 70 亿个坐标
Checkpoint某一时刻保存下来的完整模型权重Qwen2.5-3B-Instruct 是搜索的起点
Pretrained model / base model已完成预训练或指令微调、尚未针对当前任务继续适配的模型RandOpt 在 base model 附近采样,而不是从随机权重开始
Objective,目标函数算法最终想增大或减小的量。它是一个「输入模型参数,输出单个数」的函数若目标是提高 GSM8K accuracy,就写成 maximize
Reward / fitness越大越好的 objective value。fitness 是 evolutionary optimization 常用叫法200 道题答对 120 道,reward 可以取
Loss通常越小越好。它与 reward 的符号方向相反可以令 ,最大化 reward 等价于最小化 loss
Score / metric实际评测得到的数字。它可能就是 objective,也可能只是 objective 的 noisy estimateaccuracy、exact match、verifier pass rate
Task reward针对某个 downstream task 定义的 reward,不是 pretraining loss同一个 checkpoint 的 GSM8K reward 与 MBPP reward 是两张不同的局部曲面

把 weights 写成一个向量,没有把计算图拉直

更完整的模型记号是 固定 residual、branch、attention 与 parameter sharing, 只列出图上所有独立参数的当前取值。数学上可以把这些 tensors vec + concat;代码通常仍逐 tensor 加噪,candidate reward 则由完整计算图产生。这个坐标化本身没有问题,真正需要审视的是 raw Euclidean distance 与 是否给出了有功能意义的 geometry。详见 参数空间与计算图

baseline 的三种含义

出现场景含义本文如何称呼
「比 base 提升多少」未经当前方法处理的 reference model 或 reference scorebase model / base score
「与 PPO、GRPO baselines 比较」实验中的 comparison methodcomparison baseline
ES 公式里的 从所有 rewards 中减去的参考数 ,常取 population mean;它用于降 variance,不是另一个模型control-variate baseline

所以「加入 baseline 」不是再运行一个 baseline model,而是先把每个 candidate 的 reward 做中心化。例如 rewards 为 时,权重变成 ;高于平均的 perturbation 被正向加权,低于平均的被反向加权。

采样与概率分布

术语直白解释在本文中的例子
Random variable,随机变量每次采样可能得到不同值的量扰动向量
Distribution,分布规定「可能采到什么,以及各自多大概率」的规则
Gaussian / Normal distribution,高斯 / 正态分布钟形分布。靠近均值的数常见,离均值越远越少见每个 weight coordinate 加一个均值为 0 的 Gaussian noise
Standard Gaussian,标准高斯均值为 0、方差为 1 的 Gaussian 中的 是均值, 表示各坐标单位方差且不相关
Isotropic,各向同性sampling rule 不偏爱任何方向,每个正交方向的方差相同理论中的 covariance 是
Noise / perturbation,噪声 / 扰动加到 base weights 上的一小段随机变化candidate weights 为
,noise scale控制扰动有多大。 越大,candidate 通常离 base 越远RandOpt 主实验混合使用
Seed,随机种子用一个整数确定整段 pseudo-random noise;同一 seed 可重建同一 perturbation保存 top- seeds 比保存 份完整 checkpoint 便宜
Mean,均值distribution 的中心ES 更新 Gaussian mean,等于移动下一轮搜索中心
Variance / covariance,方差 / 协方差distribution 在每个方向扩散多宽,以及不同方向是否一起变化isotropic ES 固定 covariance;CMA-ES 会学习 covariance
Probability mass,概率质量某个区域被采中的概率,不是该区域的普通几何体积improving region 很大,不代表它在 Gaussian 下的 probability mass 一定大
Local neighborhood,局部邻域base checkpoint 周围由 sampling scale 定义的一小片区域「附近」必须连同 和 noise normalization 一起说明
Candidate一次采样得到、等待评测的模型变体
Population同一轮所有 candidates 的集合,大小通常记为 ES-at-Scale 每轮 ;RandOpt 主实验一次采
Positive / improving tail,正向尾部reward-change distribution 中少量明显大于 0 的样本大多数 perturbations 普通或变差,但最好的一小批能提高 task score
Best-of- 个 candidates 后只看最好的一个它测的是「有限采样能否命中 positive tail」
Top-按 score 保留最好的 个 candidatesRandOpt 从 5000 个中保留 50 个
Ensemble / majority vote多个模型一起预测,再聚合答案;majority vote 取出现次数最多的离散答案RandOpt 的最终产物默认是 50-model ensemble

梯度、估计与优化过程

术语直白解释在本文中的例子
Gradient,梯度objective 对每个 parameter 的局部斜率组成的向量,告诉我们往哪个无穷小方向变化最快
Backpropagation / backward利用 computation graph 高效算出 sample loss 对全部 parameters 的 gradient标准 SFT、PPO、GRPO 都需要 backward
Forward pass给定 weights 和 input,只计算模型输出,不对参数求导MeZO、ES、RandOpt 都能只靠 forward evaluations 获取 score
Function query / oracle call选一个 ,运行模型与评测器,得到一个 scalar function value在 200 道题上跑 candidate 并得到 accuracy,算一次 candidate evaluation
Zeroth-order,零阶只能查询 function value,不能直接取得 derivative;「零阶」不等于完全不估计 gradientMeZO 用两个 function values 构造 gradient estimate
Backprop-free不运行标准 backward。它是本文最宽的工程分类MeZO、ES、RandOpt 都是 backprop-free,但内部逻辑不同
Estimator,估计量用有限 noisy observations 近似一个未知量的公式ES 用 rewards 与 perturbations 的相关性估计 smoothed gradient
Finite difference,有限差分比较邻近两点的 function values 来近似斜率
Two-point / antithetic sampling沿同一方向同时评测 ,两点相减;共享方向能抵消一部分噪声MeZO 的默认 estimator
Iteration / step / round根据本轮 observations 更新中心,然后再采下一轮ES 有许多 sequential rounds;原始 RandOpt 只有一轮
Update算法改变下一轮 state 的动作,不一定来自真实 gradientMeZO 更新 parameter point;ES 更新 distribution mean;RandOpt 不做 sequential update
Parallelism,并行多个 candidates 同时评测。它能缩短 wall-clock latency,不减少 total work5000 个 RandOpt workers 同时跑,仍然消耗 5000 份 evaluation compute
Bias,偏差estimator 的长期平均与目标真值之间的系统差异 太大时,smoothed gradient 可能偏离 raw objective 的局部 gradient
Variance,方差重复采样时 estimator 波动多大population 太小会让 ES update direction 很抖
SNR,signal-to-noise ratio有用方向信号相对随机波动的强弱命中一个好 candidate,不代表 ES 的 aggregate update 已有足够 SNR

Smoothing 与局部几何

术语直白解释在本文中的例子
Smoothing,平滑化不直接看 ,而是看 周围许多随机点的平均 reward;尖锐的小波动会被平均掉
Smoothed objective经过上述局部平均后的新 objective。ES 的经典 estimator 对准的是它,不一定是 raw 改变 会同时改变搜索半径和被优化的
Ambient dimension,表观维度parameter vector 一共有多少 coordinates7B 模型的 约为 70 亿
Subspace / projection,子空间 / 投影只保留完整 parameter update 在少数方向上的分量 维 perturbation 压到 个 active coordinates
Effective / intrinsic dimension,有效 / 内在维度完成当前任务实际需要的自由度,可能远小于 ;具体定义依论文而异objective ID、curvature-active dimension 不能混为同一个量
Curvature,曲率gradient 随位置改变得有多快。高曲率方向稍微移动,斜率或 reward 就变化很大少数 stiff directions 可能主导局部 reward change
Hessianscalar objective 对 parameters 的二阶导数矩阵,用来描述各方向的 local curvature;exact Hessian 不保证 PSDHessian eigenvectors 给出 signed principal curvature directions
Flat / weak direction,平坦 / 弱方向沿该方向小幅移动时 objective 变化很慢noise 可能在大量 weak directions 中逐步积累
Stiff / high-curvature direction,刚性 / 高曲率方向沿该方向小幅移动就引起较大 objective changetoy model 中这些 modes 学得快
Tail accessibility给定 和 sampling distribution,有限次采样能否碰到足够好的 tail sampleBoD 的 best-of- probe 直接测这个量,而不是直接测 curvature dimension

用一个小例子串起来

假设有一个 pretrained checkpoint 和 200 道 selection questions。定义 objective 为这 200 题的 accuracy。每次从 standard Gaussian 采一个 ,得到 candidate ,再做 forward evaluations 得到 score

  • Best-of- 只问 个 candidates 中最好的 score 有多高。
  • RandOpt 保留 top- candidates,测试时让它们 majority vote。
  • ES 用全体 scores 相对 control-variate baseline 的高低来加权 ,移动下一轮 Gaussian mean。
  • MeZO 选同一个方向的 ,用两者 loss difference 估计局部 update direction。

四种方法看到的是相似的 function values,用法却不同。后文反复强调的边界也在这里:positive tail 可访问 能直接说明 Best-of- / RandOpt 有机会成功,但不能单独保证 ES estimator 的 SNR 或 MeZO 的多步收敛。

结论先行

  1. 这不是「RandOpt 一类方法」。 上位概念是 backprop-free weight-space post-training。MeZO 用两次 function query 估计局部方向;ES 用 population reward 估计 Gaussian-smoothed objective 对 search-distribution mean 的梯度;RandOpt 只是其中不估计方向、不更新分布的 sample-select-ensemble 方法。
  2. 高维并不自动成为 blessing。 对 one-shot selection,关键是指定 checkpoint、noise distribution、reward 和 selection set 下的 improving-tail mass;对 ZO / ES,还要看 estimator variance 与多步 update SNR。参数维度 本身不能回答这些问题。
  3. 强 pretrained checkpoint 把问题从「全空间学习」改成了「局部选择」。 随机扰动不必从零写入能力,只需在保留原有表示与 circuits 的局部邻域中 reweight、reroute 或 expose 已有行为。这个解释与当前证据相容,但尚未被机制实验坐实。
  4. 免 backward 主要改变 memory 和并行方式,不等于省总算力。 MeZO 与 ES 不保存标准 backward graph;RandOpt 的一次性采样仍需要 份 candidate evaluation,主实验还要在推理时运行 top- 个模型。 training rounds 依赖海量并行硬件,total work 仍是

最稳妥的 mental model 是分三层:

  • 经验层:测量局部 reward-change distribution
  • 算法层:用 selection、reward-weighted averaging 或 finite difference 消费这个分布;
  • 机制层:再问 positive tail 来自 gradient、curvature、higher-order structure,还是 evaluation noise。

现有工作对前两层已有证据,对第三层仍以假说为主。

范畴:无反向传播的权重空间后训练

本文的大类只规定两件事:搜索发生在 weight space,算法不通过标准 backward 取得 parameter gradient。它没有规定如何消费 scalar score,也不意味着算法完全不估计方向。可以沿三个轴继续分类:

  1. 在哪里探索:token/action space,还是 parameter/weight space;
  2. 如何使用 scalar score:只选 winner、构造 gradient estimator、更新 sampling distribution,还是蒸馏 winner 的 traces;
  3. 最终产物是什么:一个更新后的模型、一个 population,还是一个需要共同推理的 ensemble。
方法如何利用 function value / reward是否迭代最终产物主要成本
Plain random search / Best-of-从固定分布取最大值单个 winner 次 evaluation
SPSA / MeZO用同一方向的 / 两点差估计局部方向单模型每方向每步 2 次 forward
OpenAI-ES / ES-at-Scale用 population reward 加权扰动,移动 Gaussian mean单模型每步 个完整 reward evaluations
CMA-ES用 elite rankings 学 mean、step size 与 covariance单模型或 populationfull covariance 对 LLM 不可承受
RandOpt固定 checkpoint 邻域采样,选 top--model ensemble一次 candidates,部署时 次 generation
Iterative RandOptsample-select 后蒸馏,再以 student 为新中心重复单模型搜索 forward + distillation backward
PPO / GRPO在 token/action distribution 上做 policy gradient单模型rollout + forward/backward

最容易犯的术语错误

Derivative-free / zeroth-order 不等于 direction-free。 SPSA、MeZO 与常见 ES 都在估计某种 smoothed gradient。原始 RandOpt 才真正不构造 search gradient;它甚至不输出传统意义上的单个「优化后 checkpoint」。

Preliminaries:统一写成一个 black-box 问题

是强 pretrained checkpoint,要最大化的 task reward 为

可以包含 prompt、environment randomness 与 decoding randomness。black-box oracle 只返回 noisy scalar ,不返回 。权重空间方法共同使用下面的骨架:

  1. 采样 candidate weights;
  2. 在一组 inputs 上得到 scalar scores;
  3. 用 aggregation rule 产生 winner、ensemble 或下一步

差别主要在第三步,不在「都加了 random noise」。

Gaussian smoothing:ZO 与 ES 的共同语言

最常见的 search distribution 是

它诱导一个 Gaussian-smoothed objective:

由 Stein / score-function identity,

加入 baseline 不改变期望:

antithetic two-point estimator 则是

在同一个 objective、无限样本与合适正则条件下,两者可以估计同一个 。因此 MeZO 与 ES 并非数学上完全割裂;实际差别来自 finite-sample query design、loss/reward 的定义、population 组织与 state update。

MeZO:用两次 forward 换掉 backward

MeZO 默认每步取一个 Gaussian direction ,在同一 minibatch 上计算

实现用 RNG seed 重建 ,依次 in-place perturb、恢复并 update,不需要保存 activations、gradients、optimizer states 或完整 noise vector。它让单张 A100-80GB 可以 full-parameter tune OPT-30B,而标准 Adam FT 在同一设置只能到 2.7B;代价是通常需要远多于 first-order FT 的 steps。MeZO 的价值首先是 memory accessibility,不是普遍的 wall-clock superiority。

MeZO 的 dimension-free-looking 理论依赖 local Hessian effective rank 较小;论文没有直接测量大型 LM 的该量。prompting 还需要让 fine-tuning objective 与 pretraining landscape 足够接近。这些都是适用条件,不是从模型参数量自动推出的事实。

ES:优化 search distribution 的 mean

NES 从更一般的 search distribution 出发:

且只更新 mean ,就回到上面的 Gaussian ZO estimator。ES-at-Scale 是这种 mean-only、fixed-covariance 的简化 ES:每轮采样 个 full-parameter perturbations,用 z-scored rewards 加权所有方向,再移动中心。它不是 top- selection,也没有学习 covariance。

ES-at-Scale 的 Countdown 实验在 Qwen2.5 0.5B 到 7B 与 Llama 1B 到 8B 上用统一的 ;另有 Qwen2.5-Math-7B 与 Qwen2.5-14B 实验。结果说明小 population 的 full-parameter ES 可以实际运行并取得进展,但论文没有测 curvature dimension;「low intrinsic dimension」在原文中只是 future-work explanation。

Best-of-:只关心有没有命中

令一次 perturbation 达到至少 improvement 的概率为

个独立样本至少命中一次的概率为

若希望成功率达到 ,需要

例如 时,约 59 个 samples 才有 95% 概率命中。这个 sample complexity 取决于 tail mass,而不是显式出现的 。这正是 RandOpt 能绕开「准确恢复十亿维 vector」的地方。

但 best-of- 曲线天然有 diminishing returns:Gaussian maximum 只按 增长,accuracy 还受上界限制。因此曲线在 后 flatten,不能反推 active dimension 大约是 30。

找到好方向,比估准完整 gradient 容易

局部一阶近似给出

时,。于是任意随机方向变好的概率在纯一阶模型里约为 ,与 无关; 个方向中的最好 improvement 约为

然而单方向 estimator 满足

平均 个方向后,relative RMS error 仍约为 。所以这两件事必须分开:

找到一个 reward-improving candidate 可以几乎不依赖 ;把朴素 estimator 的完整 维 gradient vector 估准,通常仍需要

结构性低维假说的作用,是解释为什么无需把 full-space vector 估得很准,也可能在 function space 获得稳定进展;它不是说 vanilla estimator 的向量误差突然消失。

Curvature 不是 positive tail 的唯一来源

局部二阶展开为

Gaussian perturbation 下,

因此 right tail 可能来自一阶 gradient projection、少数 Hessian outliers、higher-order / nonlocal structure,或 finite-prompt evaluation noise。尤其 pretrained point 往往不是 downstream reward 的 stationary point,一阶项可能已经足以解释 tail。仅观察到 positive tail,不能识别「少数 high-curvature directions」这个机制。

Degeneracy:高维 fiber 不等于高概率

假设 reward 真的只依赖一个 维 projection:

此时 ,与 ambient dimension 无关。固定 的 preimage 确实是一个 维 affine fiber,所以有大量 full-space perturbations 共享相同有效投影。但 improving probability 是

真正决定命中率的是 projected improving set 的 Gaussian mass。fiber 维度很大只说明 representation degeneracy,不会自动增加 probability mass;weak curvature、orthogonal gradient 与 higher-order terms 还会破坏「同一 projection 等于同一 reward」。

SPSA、NES 与 OpenAI-ES

SPSA 的关键贡献是用一个 Rademacher direction 的两次 function queries 同时估计全部 coordinates,把 coordinate finite difference 的 queries 降成 2;代价转移到 variance。NES 把目标改写为 search-distribution 的 expected fitness,再对 distribution parameters 做 natural gradient。OpenAI-ES 证明 scalar rewards、shared noise seeds 与大规模并行可以训练较小的 neural policies。

这条经典谱系提供了算法,不足以解释为什么 可以在 billion-parameter LLM 上 work。后者正是 ES-at-Scale 与 BoD 想回答的问题。

MeZO 与 GRZO:two-point ZO 线

MeZO 用 seed replay 把 full-parameter ZO 的 peak memory 压到 inference level。GRZO 再借 Flipout-style sign factorization,在一个 mini-batch 内构造 个伪独立 directions,并用 group-relative normalization 降低 estimator variance;两个 fused forward calls 不等于 次模型调用。

GRZO 当前只验证 classification 与 teacher-forced QA loss,不是 RLVR 或 long-horizon reward 实验;其「GRPO-style」只指 group normalization,不包含 policy ratio、clipping、rollout 或 policy gradient。arXiv v1 也没有给出官方代码仓库。

ES-at-Scale 与 QES:distribution-gradient 线

ES-at-Scale 把 fixed-covariance mean update 直接扩到 full-parameter LLM。QES 则把 ES-style search 搬进 quantized integer lattice:stochastic rounding 产生离散 perturbations,accumulated error feedback 保存小于一个 quantization step 的更新信号,seed replay 避免保存 full-precision residual。

QES 的意义是解决 low-bit search 的「小更新被 round 掉」,不是为 low-dimensional curvature 提供新证据。其 reasoning 配置在论文 v2 中还有 population 口径歧义:正文写 antithetic pairs,超参表写 ,官方脚本则对应 25 pairs / 50 evaluations。复现时应以版本化代码和实际 evaluation count 为准。

Neural Thickets:从更新中心转向保留 population

Neural Thickets 把 pretrained checkpoint 看成一个 local prior 的中心。论文定义 solution density:

它测的是指定 sampling distribution 下的 finite-sample hit rate,不是 coordinate-invariant 的 weight-space volume,也不是 local-minimum density。论文里的「expert」只表示该 benchmark score 更高,不自动意味着新技能、独立 circuit 或真正的 task optimum。

Neural Thickets 的主张与 RandOpt 流程。右侧 指 optimization rounds;总 evaluation work、硬件数与 inference ensemble 成本并没有消失。

RandOpt 到底做了什么

给定 noise-scale set ,原始 RandOpt 的算法只有一次搜索:

  1. 采样 个 seeds,并为每个 seed 分配一个
  2. 构造
  3. 在同一个小 training / validation set 上 greedy evaluate 所有 candidates;
  4. 选出 top- seeds;
  5. 对每个 test input,用这 个权重变体各生成一次,再对抽取后的离散答案做 majority vote。

主表的 RandOpt (random) 使用 ,每个任务取 training set 前 200 条做 selection。模型覆盖 Qwen2.5-Instruct 0.5B 到 3B、OLMo3-7B base/instruct 与 Llama3.1-8B-Instruct;任务以可验证的离散输出为主。ROCStories 实际是五句排序,USPTO-50K 是十类反应分类,不应把它们描述成自由故事生成或 retrosynthesis。

代码用 greedy decoding,因此 population diversity 来自 weight perturbation,而不是每个模型的 decoding randomness。top candidates 可以只存 seed 与 ,需要时重建权重,不必永久存 50 份 checkpoint。

论文直接支持什么

  • 在固定 的 Qwen2.5-Instruct 0.5B 到 32B probe 中,matching-or-better fraction 从 0% 增至 64%(GSM8K),从 8% 增至 60%(Countdown)。这是 solution density 随 model scale 增大的直接证据。
  • 500 个 perturbations 在 7 个任务上的排名相关性随规模下降,说明 local variants 越来越 task-specific。它不证明同一任务 top- 的 prediction errors 必然互补。
  • RandOpt 在 math、code、分类任务与 GQA 上取得明显提升;Qwen2.5-VL-3B-Instruct 的 GQA 从 56.6 增至 69.0。
  • 从 scratch 与 GPT-2 0.1B 几乎不工作,0.5B 增益有限,支持「需要足够好的 pretraining」这一边界;它不建立普适的参数量 threshold。
  • 已可提升,但多数任务依赖 ensemble 才有竞争力。RandOpt 更像一个被 reward 选择出来的 committee,而不是单 checkpoint optimizer。
  • 对主表 42 个 model-task cells 逐项统计,RandOpt 相对 base 是 42/42 提升,相对 的 1-pass 结果是 30/42 胜;但与同为 50-pass inference 的 ES+TT-MV 比较时只有 15 胜、1 平、26 负。最稳结论是「random search + ensemble 普遍改善 base,并对 1-pass RL 有竞争力」,不是「胜过 iterative ES」。

MBPP 的发布实现把官方 train、validation、test 拼接后再按前 200 / 其余切分,MATH-500 也使用前 200 / 后 300 的非标准划分。它们没有 selection-test overlap,但数值不适合与标准 leaderboard 直接横比。ROCStories 的 ensemble 代码还把非零 partial score 当作整题正确,而 raw-model path 曾按 partial score 求平均,两条评估路径并非同一 metric;该列尤其不宜解释成 creative-writing 能力。

一部分 gain 是 reasoning,另一部分只是 format

GSM8K / Qwen2.5-3B-Instruct 的行为拆分。RandOpt 达到 86.7%,其中 12.3% 的问题由错误 reasoning 变成正确,19.0% 只修正了 answer format;相对 base-correct cases 的 regression 为 0.7%。top-1 的 regression 是 14.7%,说明 ensemble 的主要作用之一是抵消 individual perturbation 的回退。

这张图支持「邻域中确实有 reasoning-improving variants」,也暴露了 verifier sensitivity。它没有定位对应 circuit,更没有证明 format 与 reasoning 来自同一低维 curvature subspace。

真实工程账本

维度RandOpt 的实际含义
Adaptive depth1 次 selection round;无 sequential parameter update
Total training work 个 candidate-prompt evaluations,主表约
Wall-clock只有在大量 workers 同时存在时才接近一次 evaluation;论文的 3.2 min showcase 使用 200 张 GH200、,约为 10.7 GH200-hours,未报告 utilization
Communicationworkers 只需回传 seeds、 与 scalar scores
Stored statebase checkpoint + top- seeds 即可重建
Inference主结果每个 input 需要 次 generation
Output一个 ensemble; 或 distillation 后才是单模型

「same training FLOPs」也需要谨慎。论文按 forward 约 、backward 额外约 估算,但把附录表的超参数代回其公式,RandOpt、ES、GRPO、PPO 分别约为 2.000M、2.004M、13.107M、1.075M ,并不相等;ES 还同时出现 两种口径。即便只接受作者的归一化,headline 也没有把 RandOpt 的 test-time generation 纳入同一个 system budget。更可靠的报告应同时列出 training FLOPs、sequential depth、hardware count、GPU-hours 与 amortized inference cost。

selection overfitting 也不能忽略:5000 个 candidates 都在同一组 200 条 training examples 上排名,虽然最终在 test split 汇报,但论文没有用 fresh prompts 重评 finalists,也没有分析 增大时 winner’s curse。若 observed score 为 ,即使所有真实 相同,Gaussian evaluation noise 的 selected maximum 也会约虚高

发布代码还留下两个会影响几何解释的实现问题。其一,noise worker 对每个 parameter tensor 都用同一 seed 重新初始化 generator,不同层会复用 Gaussian sequence 的前缀,实际 covariance 未必是论文写的 full-vector i.i.d. 。其二,代码在 bf16 weights 上原位加噪再减噪恢复,加减不严格可逆,长序列 candidate evaluation 可能产生 drift 和 order dependence;论文没有报告对应检查。

Distillation 与 Iterative RandOpt

Neural Thickets 用 top-50 teachers 产生约 25K traces,再做两轮 distillation,把 的推理开销压回单模型。GSM8K 上,Qwen2.5-1.5B 从 ensemble 76.4% 降到 distilled 74.9%,3B 从 87.1% 降到 84.3%;作者估计 distillation 约增加原 search 2% 的 training compute。

2026-07 的官方 Iterative RandOpt blog 再把这一步做成循环:

其 OLMo-3-7B / GSM8K demo 在四轮后得到单模型 92.87%,matched-FLOP ES 略低于 89%。这是官方 blog 的新结果,不是 Neural Thickets 论文的 peer-reviewed evidence。distillation 阶段仍用 supervised per-token loss 和 backward,因此 Iterative RandOpt 整体不再是纯 backprop-free 方法。

如何读「四句话压缩」

下面逐句保留原 insight,再标注 grounding。

1. 「LLM 参数空间虽然极高维,但微调奖励可能主要由少数高曲率方向控制。」

状态:合理的机制假说,不是当前实验已证事实。

BoD 的 best-of- probe 直接测到的是 improving tail 在 Qwen2.5 0.5B 到 7B 上没有随规模系统消失;Appendix 的 curvature proxy 定义和 normalization 不完整。MeZO 假设 low effective rank,ES-at-Scale 只把 low intrinsic dimension 写成 future work,Neural Thickets 完全没有测 Hessian。还必须保留一阶 gradient 足以解释 tail 这个 alternative。

2. 「这些方向学习得快,而大量平坦方向中的噪声积累得慢,因此训练奖励可能呈现先上升、后下降的非单调变化。」

状态:quadratic additive-noise model 中的 sufficient mechanism,真实训练中的因果性未识别。

该机制还要求特定 initialization、mixed-sign amplitudes、不同 relaxation rates 与足够高的 noise floor。exactly flat modes 是 random walk,并没有 finite stationary variance。真实 ES / GRPO 是否满足局部 quadratic、state-independent isotropic noise 与 single-basin 假设,论文没有验证;详见 BoD 的数学审计

3. 「高维参数空间中的有效更新并不是唯一的,而是存在大量在关键低维子空间中具有相似投影的扰动方向。」

状态:在 projection-only assumption 下数学成立。

维 fibers 说明同一 effective projection 有很多 full-space representatives,但不说明 success probability 随 增大。命中率仍由 projected improving set 的 Gaussian mass 决定。若 orthogonal gradient、weak-but-nonzero curvature 或 higher-order terms 不可忽略,「相似投影」也不再保证相似 reward。

4. 「因此,ES 不需要准确恢复完整的十亿维梯度,只需要通过少量随机采样命中奖励变化分布中的正向尾部。」

状态:前半句是好 intuition;后半句对 RandOpt 直接成立,对 ES 不充分。

RandOpt 只需要 top- 中出现好样本。ES-at-Scale 的实际 update 使用全部 z-scored rewards,负 reward directions 也以负权重参与;它需要 population 中 reward 与 perturbation 的相关性形成足够 SNR。one-step tail accessibility 不保证 reward-weighted estimator 的多步稳定性。

更严谨的四句话版本

  1. 大模型 checkpoint 周围的 task-reward distribution 可能由少数 active directions 主导,但现有实验直接测到的是 improving tail,而不是 active dimension。
  2. 异质 curvature 与持续 update noise 在 quadratic model 中足以产生 rise-then-decay;真实训练是否由此导致仍待 causal test。
  3. 若 reward 主要依赖低维 projection,同一有效投影对应大量 full-space perturbations;这种 degeneracy 让 ambient dimension 不必成为 curse,却不会自动提高命中率。
  4. RandOpt 可以用 best-of- 直接利用 positive tail;ES 也可能用低精度 search gradient 前进,但还需要 reward-weighted aggregate 具有足够 SNR。

BoD、ES-at-Scale 与 Neural Thickets 各自补了什么

工作直接测量能支持的 claim不能支持的 claim
ES-at-Scale小 population 的多步 full-parameter ES 结果 在所测 LLM/reward 上可以训练原因一定是 low curvature dimension
BoDQwen2.5 0.5B 到 7B 的 one-step best-of- tail;toy dynamics所测尺度内 tail accessibility 未系统恶化;rise-decay 有一个简单充分机制 等于 active dimension;tail 已证明来自 top-curvature projection
Neural Thickets / RandOptQwen2.5 0.5B 到 32B solution density、跨任务 diversity、end-to-end ensemble强 checkpoint 邻域确有可被选择的 task-improving variants这些 variants 是 local minima、新技能或独立 circuits

三者合起来形成一条合理证据链:训练现象存在 → 局部 tail 可接触 → selection 本身可以变成算法。 尚未闭合的是「tail 为什么存在」与「它为什么随 scale 变密」的因果链。

强 pretrained checkpoint 为什么改变问题

从 scratch training 是在巨大空间中构造复杂 function;RandOpt 是以 为中心,在 task-conditioned local prior

中挑选 behavioral variants。pretraining 可能带来已有 representations、circuits 与 latent skills;overparameterization 和 symmetry 可能提供近等价参数化;小 还保留 general competence。于是小参数扰动只需 reroute 或 reweight,不必从零编码能力。

这里有两个重要边界:

  • aggregate pretraining loss 看起来 flat,不妨碍 per-task reward surfaces 在同一位置很 spiky;RandOpt 消费的是后者。
  • one-shot local selection 更擅长 elicitation / sharpening。新知识注入、强 domain shift 或需要多步累积改变的任务,可能必须离开 local thicket;这时 MeZO、ES、RL 或 gradient FT 更合适。

它与 内在维度权重空间几何 相邻,但不能混成同一概念:objective intrinsic dimension、curvature-active dimension、update rank 与 improving-tail probability 分别回答不同问题。

什么时候选哪种方法

条件更合适的起点主要风险
differentiable supervised loss,显存是主要瓶颈MeZO / ZO-PEFTsteps 多、directional variance 高,未必更快
reward 不可微或由完整 trajectory 定义,需要单 checkpointES-at-Scale 类 mean update每轮 population rollout 贵,多步 SNR 未必稳定
有极大并行资源、小 selection set、离散可投票答案,ensemble 可接受RandOpt 次 search 与 次 inference;selection overfitting
需要单模型部署,但相信局部 population 有用RandOpt + distillation第二阶段重新引入 backward;teacher errors 会被固化
必须在 INT4 / INT8 lattice 内直接搜索QESdiscrete estimator 理论弱、replay 与 population 口径需复核
two-point ZO 的主要问题是 minibatch varianceGRZO 类 structured directions当前证据集中在分类/teacher-forced loss,非 RLVR
需要学习 sampling geometrydiagonal / layerwise / low-rank ES 或 trajectory-guided samplingfull CMA covariance 是 ,对 LLM 不现实

最有信息量的下一步实验

  1. 识别 tail 的来源。 估计 reward Hessian top subspace,比较 top-subspace、orthogonal-complement 与 isotropic perturbations。若 orthogonal tail 同样强,high-curvature explanation 会被直接削弱。
  2. 修正 scale confound。 标准 Gaussian 满足 ;跨模型固定 per-coordinate 并非固定 radius。应并列 fixed-、layer-relative、weight-norm normalized 与 fixed logit-displacement noise。若 scaling trend 消失,所谓 blessing 主要是 parameterization artifact。
  3. 控制 winner’s curse。 selection split 排名,fresh prompts / generation seeds 重评 finalists,最后只在 held-out test 汇报; 越大,validation evidence 也应增加。
  4. 区分 latent elicitation 与 new-skill learning。 设计 base model 在大 sampling 下仍失败、且需要新知识或新 algorithm 的任务,扫描 search radius 与 sequential rounds。若 local RandOpt 仍成功,才构成更强的 capability-expansion 证据。
  5. 学习 structured covariance。 用训练轨迹、短 probe 或 HVP 估计低秩 / layerwise sampling directions。这与 Update-Anchored Post-Training 的 Constrained Parameter Sampling 直接相接;关键 baseline 是相同 trace 与 compute 下的 isotropic、random low-rank 和 learned low-rank noise。
  6. 把 committee 收回单模型。 比较 weight averaging、logit distillation、trace distillation 与 iterative search,跟踪 pass@1、pass@、旧任务保持率和 calibration,而不只看最终 accuracy。
  7. 把 system budget 对齐。 同时报告 training FLOPs、GPU-hours、hardware count、adaptive depth、selection data 与 amortized test-time compute;否则 one-step parallelism 与 sequential training 很难公平比较。

与现有知识库的连接

  • BoD:本笔记的理论动机与四句 insight 来源;该 paper note 已对 rise-then-decay、tail probe 和 curvature proxy 做逐式审计。
  • 内在维度:区分 representation/data ID、objective/parameter ID 与这里的 curvature/tail notions。
  • 权重空间几何:RandOpt 应放进「task-conditioned local reward geometry」分支,不能从 pretraining-loss flatness 直接推出。
  • 从 Checkpoint 平均,到 Task Expert 合并,再到专家蒸馏:把 RandOpt 放在「能力在 pretrained neighborhood 中可被采样」的更大后训练图景里。
  • Update-Anchored Post-Training:把 isotropic RandOpt 推广为 trajectory / probe direction 引导的 structured sampling。

建议给 权重空间几何 后续补一条待验证分支:reward-defined stochastic geometry,包括 solution density、tail accessibility、curvature-active subspace 与 sampling-distribution dependence。当前不应把它写进 stable mental model,因为 causal alignment test 仍缺失。

Primary sources

Research log

  • 2026-07-10:以 SPSA、NES、OpenAI-ES、MeZO、ES-at-Scale、QES、Neural Thickets、GRZO 与 Iterative RandOpt 的 primary sources 建立谱系;未找到专门覆盖「LLM full-parameter ZO + ES + RandOpt」的 canonical survey,因此没有用二手综述代替原文。
  • 直接证据:Neural Thickets 的 solution density / behavior decomposition;BoD 的 one-step tail probe;ES-at-Scale 的多步 training curves;MeZO / GRZO / QES 的各自 implementation results。
  • 机制假说:low curvature-active dimension、projection degeneracy、pretraining-induced thicket;当前没有一篇工作同时测量 active subspace、tail projection 与 multi-step update SNR。
  • 复现风险:Neural Thickets 的 compute normalization 与 ES hyperparameters 存在口径矛盾;官方 RandOpt 实现按 parameter tensor 重置同一 RNG seed,实际 noise covariance 未必等于论文写的 full-vector i.i.d. ;QES 的 population 配置也有版本歧义。