大规模语言模型的后训练新范式 —— 随机采样即 competitive

论文: Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
作者: Yulu Gan, Phillip Isola (MIT)
arXiv: 2603.12228
代码: https://github.com/sunrainyg/RandOpt

传统的后训练(Post-Training)方法——无论是 PPO、GRPO 还是进化策略(ES)——都遵循同一个范式:从预训练权重出发,通过迭代优化逐步逼近任务最优。但这篇论文提出了一个颠覆性的视角:预训练的结果本身就是一个参数分布,其支持集中已经包含了任务特定的专家模型


核心发现:Thicket 现象

作者们发现了一个反直觉的现象:

随着模型规模增大,预训练权重周围的高斯邻域内,任务专家的密度会急剧增加。

模型规模 特性
小模型 (0.5B) “Needle in Haystack” —— 优质解稀疏,需要结构化搜索
大模型 (7B+) “Thicket Regime” —— 优质解密集分布,随机采样即可发现

这一发现直接挑战了后训练必须”迭代优化”的传统认知。如果优质解就在附近密集分布,为什么要费时费力地梯度下降?直接随机采样 + 选择 + 集成可能更高效。


关键概念

1. Solution Density(解密度)

作者定义了解密度 \(\delta(m)\) 来量化这一现象:

\[ \delta(m) = \mathbb{P}_{\bm{\epsilon}\sim\mathcal{N}(\mathbf{0},\sigma^{2}\mathbf{I})}\left[s(\bm{\theta}+\bm{\epsilon}) \geq s(\bm{\theta})+m\right] \]

即:在预训练权重 \(\theta\) 的高斯邻域内,性能比基线提升至少 \(m\) 的扰动比例。

关键观察: 实验表明 \(\delta(m)\) 随模型规模单调递增。Qwen2.5-32B 的解密度远高于 Qwen2.5-0.5B。

2. Spectral Discordance(谱分歧度)

为了度量不同任务专家之间的多样性,作者引入了谱分歧度:

\[ \mathcal{D} = 1 - \frac{1}{M(M-1)}\sum_{j\neq k}\mathbf{C}_{jk} \]

其中 \(\mathbf{C}\) 是任务性能排名的 Pearson 相关矩阵。\(\mathcal{D} \to 1\) 表示专家高度特化(不同任务需要不同专家),\(\mathcal{D} \to 0\) 表示通才结构。

理论边界:\(0 \leq \mathcal{D} \leq \frac{M}{M-1}\)

发现: 随着模型规模增大,\(\mathcal{D}\) 也增大,说明大模型倾向于学习更多专门化的专家解。


RandOpt 算法:极简后训练

基于上述发现,作者提出了 RandOpt(Random Optimization)——一个完全并行的后训练方法。

算法流程

训练阶段(随机采样+选择):

1
2
3
4
5
6
7
1. 随机采样 N 个扰动种子
θ_i = θ + σ_i · ε(seed_i)

2. 在训练集上评估每个扰动的性能 v_i

3. 选择 Top-K 个最优扰动
I_top = arg topK_i[N] (v_i)

推理阶段(集成预测):

\[ \hat{y} = \mathop{\mathrm{mode}}\left(\left\{\mathop{\mathrm{arg\,max}}_{y}f_{\bm{\theta}_i}(y|x) \mid i\in\mathcal{I}_{\text{top}}\right\}\right) \]

即:Top-K 专家分别预测,多数投票决定最终输出。

伪代码

1
2
3
4
5
6
7
8
9
10
11
# 训练:选择 Top-K 种子
seeds = [sample_seed() for _ in range(N)]
sigmas_per_seed = [sigmas[i // (N // len(sigmas))] for i in range(N)]
scores = [evaluate(theta + sigmas_per_seed[i] * eps(seeds[i]), D_train)
for i in range(N)]
top_indices = topk(scores, K).indices

# 推理:集成预测
answers = [generate(theta + sigmas_per_seed[i] * eps(seeds[i]), x)
for i in top_indices]
prediction = majority_vote(answers)

超参数设置

参数 典型值
扰动强度 \(\sigma\) 0.005 (可视化) / 多尺度网格搜索
采样数 \(N\) 5000 (纯随机) / 100 × 50 迭代 (RandOpt-ES)
集成大小 \(K\) 50
训练集大小 200 样本
精度 bfloat16
最大序列长度 1024

实验结果

计算效率对比

方法 FLOPs 公式 特点
GRPO \(8 \cdot T_{\text{GRPO}} \cdot B \cdot G \cdot PL\) 需要多步迭代
PPO \(14 \cdot T_{\text{PPO}} \cdot B \cdot G \cdot PL\) 需要训练 Critic
ES/RandOpt \(2 \cdot T_{\text{ES}} \cdot N \cdot D \cdot PL\) 完全并行

RandOpt 是 \(\mathcal{O}(1)\) 的训练步数——与迭代方法不同,它不需要 \(T\) 步收敛,采样 \(N\) 个扰动后选择即可。

主要性能结果

数学推理 (GSM8K):

模型 基线 RandOpt GRPO PPO ES
Qwen2.5-0.5B-Inst 39.9% 61.2% 42.6% 42.6%
Qwen2.5-1.5B-Inst 58.8% 76.4% 74.9%
Qwen2.5-3B-Inst 79.8% 87.1% 84.3%
Qwen2.5-7B-Inst 82.8% 88.5% 87.2%

其他任务:

模型 任务 基线 RandOpt
OLMo3-7B-Inst Countdown 59.0% 70.0%
Qwen2.5-7B-Inst MATH-500 37.1% 55.4%
Qwen2.5-7B-Inst MBPP 72.6% 75.8%
Qwen2.5-VL-7B GQA 61.4% 63.2%

关键结论

“RandOpt is \(\mathcal{O}(1)\) in training steps, FLOP-efficient, and competitive in converged accuracy with GRPO and ES for contemporary large-scale models”

Wall-clock 时间: 在 200 张 GH200 集群上,OLMo-3-7B-Instruct 在 Countdown 任务上仅需 3.2 分钟 (\(N=2000, K=50\))。


为什么预训练会产生 Thicket?

作者通过 1D 信号实验(Section 3)揭示了 Thicket 的形成机制:

预训练类型 扰动效应 原因
无预训练 可忽略 随机初始化,无结构
单一信号预训练 已达天花板 已针对单一任务优化
混合信号预训练 多样化优质解 任务多样性创造了丰富的局部最优

核心洞见:在多样化任务上预训练,相当于在参数空间中铺设了一条”解的高速公路”——不同任务的最优解在预训练权重附近交错分布,形成”Thicket”(灌木丛)。


蒸馏:从集成到单模型

直接部署 Top-K 集成模型有工程上的不便。作者探索了将集成蒸馏回单一模型的方法:

模型 方法 GSM8K
Qwen2.5-1.5B-Inst 基线 58.8%
蒸馏 74.9%
RandOpt 集成 76.4%
Qwen2.5-3B-Inst 基线 79.8%
蒸馏 84.3%
RandOpt 集成 87.1%

蒸馏算法:SFT(监督微调)

注意:蒸馏使用的是监督微调(SFT),而非强化学习。

具体流程

  1. 数据生成: 使用 Top-50 模型在 500 个训练样本上生成 25,000 个响应
  2. 困难样本筛选: 仅保留”困难样本”——即 8 个候选答案中超过一半不正确的样本
  3. 监督训练: 在基线模型上进行 2 个 epoch 的 SFT

损失函数:

\[ \mathcal{L}_{\text{Distill}}(\theta) = -\sum_{t=T_x+1}^T \log p_\theta(s_t \| x, s_{<t}) \]

即最大化生成推理轨迹和最终答案的似然。

蒸馏成本: 仅约预训练成本的 2%(50 个模型 × 10 步 SGD vs. 5000 的采样群体)。


误差分解分析

在 GSM8K 上(Qwen2.5-3B-Instruct, \(N=3000, K=50\)):

类别 比例 说明
总准确率 86.7%
推理改进 12.3% 基线错误 → 自适应正确
格式修复 19.0% “格式灌木丛”效应
回退 0.7% 基线正确 → 自适应错误

有趣的是,近 20% 的提升来自格式改进——说明预训练模型周围存在专门的”格式专家”,能够生成更规范、更易解析的输出。


与现有方法的对比

维度 PPO GRPO ES RandOpt
Critic Model 需要 不需要 不需要 不需要
迭代步数 \(\mathcal{O}(T)\) \(\mathcal{O}(T)\) \(\mathcal{O}(T)\) \(\mathcal{O}(1)\)
并行度 中等 完全并行
梯度计算 需要 需要 不需要 不需要
优势估计 Critic 基线 组内归一化 群体排名 Top-K 选择
适合规模 全规模 中小规模 全规模 大规模

RandOpt 的核心优势:当模型规模足够大(进入 Thicket Regime),随机采样即可发现 competitive 的解,无需昂贵的迭代优化


局限与思考

  1. 规模门槛: RandOpt 的优势在大模型上才显现。小模型(<1B)仍然处于”Needle in Haystack”阶段,需要更结构化的搜索。

  2. 采样成本: 虽然训练是 \(\mathcal{O}(1)\),但需要评估 \(N\) 个扰动(如 5000 个)。这在计算资源有限时仍是负担。

  3. 集成部署: Top-K 集成增加了推理复杂度,蒸馏是可行的解决方案但会损失部分性能。

  4. 任务依赖: 并非所有任务都表现出相同的 Thicket 密度。作者发现数学推理任务尤其适用,但其他任务需要具体分析。


总结

Neural Thickets 为我们理解预训练与后训练的关系提供了一个全新视角:

预训练不仅仅是”好的初始化点”,它实际上在参数空间中编码了一个丰富的解分布。

这一发现对 LLM 后训练实践有深远影响:

  1. 对于大模型,简单的随机采样+选择可能就是足够好的后训练方法
  2. 计算资源分配可能需要重新思考——与其花大量算力在迭代优化上,不如探索预训练权重的邻域
  3. 集成方法的价值被重新凸显——Top-K 扰动不仅仅是”候选”,而是真正的”专家”

正如作者所言:

“We view the outcome of pretraining as a distribution over parameter vectors, whose support already contains task-specific experts.”

这可能是后训练领域的一个范式转变的开始。


参考链接: - 论文: https://arxiv.org/abs/2603.12228 - 代码: https://github.com/sunrainyg/RandOpt


Neural Thickets:预训练权重周围密集的任务专家
https://kissshhot.github.io/2026/08/17/neural-thickets-randopt/
作者
Ding Yi
发布于
2026年8月17日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。