大规模语言模型的后训练新范式 —— 随机采样即 competitive
论文: Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
作者: Yulu Gan, Phillip Isola (MIT)
arXiv: 2603.12228
代码: https://github.com/sunrainyg/RandOpt
传统的后训练(Post-Training)方法——无论是 PPO、GRPO 还是进化策略(ES)——都遵循同一个范式:从预训练权重出发,通过迭代优化逐步逼近任务最优。但这篇论文提出了一个颠覆性的视角:预训练的结果本身就是一个参数分布,其支持集中已经包含了任务特定的专家模型。
核心发现:Thicket 现象
作者们发现了一个反直觉的现象:
随着模型规模增大,预训练权重周围的高斯邻域内,任务专家的密度会急剧增加。
| 模型规模 | 特性 |
|---|---|
| 小模型 (0.5B) | “Needle in Haystack” —— 优质解稀疏,需要结构化搜索 |
| 大模型 (7B+) | “Thicket Regime” —— 优质解密集分布,随机采样即可发现 |
这一发现直接挑战了后训练必须”迭代优化”的传统认知。如果优质解就在附近密集分布,为什么要费时费力地梯度下降?直接随机采样 + 选择 + 集成可能更高效。
关键概念
1. Solution Density(解密度)
作者定义了解密度 \(\delta(m)\) 来量化这一现象:
\[ \delta(m) = \mathbb{P}_{\bm{\epsilon}\sim\mathcal{N}(\mathbf{0},\sigma^{2}\mathbf{I})}\left[s(\bm{\theta}+\bm{\epsilon}) \geq s(\bm{\theta})+m\right] \]
即:在预训练权重 \(\theta\) 的高斯邻域内,性能比基线提升至少 \(m\) 的扰动比例。
关键观察: 实验表明 \(\delta(m)\) 随模型规模单调递增。Qwen2.5-32B 的解密度远高于 Qwen2.5-0.5B。
2. Spectral Discordance(谱分歧度)
为了度量不同任务专家之间的多样性,作者引入了谱分歧度:
\[ \mathcal{D} = 1 - \frac{1}{M(M-1)}\sum_{j\neq k}\mathbf{C}_{jk} \]
其中 \(\mathbf{C}\) 是任务性能排名的 Pearson 相关矩阵。\(\mathcal{D} \to 1\) 表示专家高度特化(不同任务需要不同专家),\(\mathcal{D} \to 0\) 表示通才结构。
理论边界:\(0 \leq \mathcal{D} \leq \frac{M}{M-1}\)
发现: 随着模型规模增大,\(\mathcal{D}\) 也增大,说明大模型倾向于学习更多专门化的专家解。
RandOpt 算法:极简后训练
基于上述发现,作者提出了 RandOpt(Random Optimization)——一个完全并行的后训练方法。
算法流程
训练阶段(随机采样+选择):
1 | |
推理阶段(集成预测):
\[ \hat{y} = \mathop{\mathrm{mode}}\left(\left\{\mathop{\mathrm{arg\,max}}_{y}f_{\bm{\theta}_i}(y|x) \mid i\in\mathcal{I}_{\text{top}}\right\}\right) \]
即:Top-K 专家分别预测,多数投票决定最终输出。
伪代码
1 | |
超参数设置
| 参数 | 典型值 |
|---|---|
| 扰动强度 \(\sigma\) | 0.005 (可视化) / 多尺度网格搜索 |
| 采样数 \(N\) | 5000 (纯随机) / 100 × 50 迭代 (RandOpt-ES) |
| 集成大小 \(K\) | 50 |
| 训练集大小 | 200 样本 |
| 精度 | bfloat16 |
| 最大序列长度 | 1024 |
实验结果
计算效率对比
| 方法 | FLOPs 公式 | 特点 |
|---|---|---|
| GRPO | \(8 \cdot T_{\text{GRPO}} \cdot B \cdot G \cdot PL\) | 需要多步迭代 |
| PPO | \(14 \cdot T_{\text{PPO}} \cdot B \cdot G \cdot PL\) | 需要训练 Critic |
| ES/RandOpt | \(2 \cdot T_{\text{ES}} \cdot N \cdot D \cdot PL\) | 完全并行 |
RandOpt 是 \(\mathcal{O}(1)\) 的训练步数——与迭代方法不同,它不需要 \(T\) 步收敛,采样 \(N\) 个扰动后选择即可。
主要性能结果
数学推理 (GSM8K):
| 模型 | 基线 | RandOpt | GRPO | PPO | ES |
|---|---|---|---|---|---|
| Qwen2.5-0.5B-Inst | 39.9% | 61.2% | 42.6% | — | 42.6% |
| Qwen2.5-1.5B-Inst | 58.8% | 76.4% | 74.9% | — | — |
| Qwen2.5-3B-Inst | 79.8% | 87.1% | 84.3% | — | — |
| Qwen2.5-7B-Inst | 82.8% | 88.5% | 87.2% | — | — |
其他任务:
| 模型 | 任务 | 基线 | RandOpt |
|---|---|---|---|
| OLMo3-7B-Inst | Countdown | 59.0% | 70.0% |
| Qwen2.5-7B-Inst | MATH-500 | 37.1% | 55.4% |
| Qwen2.5-7B-Inst | MBPP | 72.6% | 75.8% |
| Qwen2.5-VL-7B | GQA | 61.4% | 63.2% |
关键结论
“RandOpt is \(\mathcal{O}(1)\) in training steps, FLOP-efficient, and competitive in converged accuracy with GRPO and ES for contemporary large-scale models”
Wall-clock 时间: 在 200 张 GH200 集群上,OLMo-3-7B-Instruct 在 Countdown 任务上仅需 3.2 分钟 (\(N=2000, K=50\))。
为什么预训练会产生 Thicket?
作者通过 1D 信号实验(Section 3)揭示了 Thicket 的形成机制:
| 预训练类型 | 扰动效应 | 原因 |
|---|---|---|
| 无预训练 | 可忽略 | 随机初始化,无结构 |
| 单一信号预训练 | 已达天花板 | 已针对单一任务优化 |
| 混合信号预训练 | 多样化优质解 | 任务多样性创造了丰富的局部最优 |
核心洞见:在多样化任务上预训练,相当于在参数空间中铺设了一条”解的高速公路”——不同任务的最优解在预训练权重附近交错分布,形成”Thicket”(灌木丛)。
蒸馏:从集成到单模型
直接部署 Top-K 集成模型有工程上的不便。作者探索了将集成蒸馏回单一模型的方法:
| 模型 | 方法 | GSM8K |
|---|---|---|
| Qwen2.5-1.5B-Inst | 基线 | 58.8% |
| 蒸馏 | 74.9% | |
| RandOpt 集成 | 76.4% | |
| Qwen2.5-3B-Inst | 基线 | 79.8% |
| 蒸馏 | 84.3% | |
| RandOpt 集成 | 87.1% |
蒸馏算法:SFT(监督微调)
注意:蒸馏使用的是监督微调(SFT),而非强化学习。
具体流程:
- 数据生成: 使用 Top-50 模型在 500 个训练样本上生成 25,000 个响应
- 困难样本筛选: 仅保留”困难样本”——即 8 个候选答案中超过一半不正确的样本
- 监督训练: 在基线模型上进行 2 个 epoch 的 SFT
损失函数:
\[ \mathcal{L}_{\text{Distill}}(\theta) = -\sum_{t=T_x+1}^T \log p_\theta(s_t \| x, s_{<t}) \]
即最大化生成推理轨迹和最终答案的似然。
蒸馏成本: 仅约预训练成本的 2%(50 个模型 × 10 步 SGD vs. 5000 的采样群体)。
误差分解分析
在 GSM8K 上(Qwen2.5-3B-Instruct, \(N=3000, K=50\)):
| 类别 | 比例 | 说明 |
|---|---|---|
| 总准确率 | 86.7% | — |
| 推理改进 | 12.3% | 基线错误 → 自适应正确 |
| 格式修复 | 19.0% | “格式灌木丛”效应 |
| 回退 | 0.7% | 基线正确 → 自适应错误 |
有趣的是,近 20% 的提升来自格式改进——说明预训练模型周围存在专门的”格式专家”,能够生成更规范、更易解析的输出。
与现有方法的对比
| 维度 | PPO | GRPO | ES | RandOpt |
|---|---|---|---|---|
| Critic Model | 需要 | 不需要 | 不需要 | 不需要 |
| 迭代步数 | \(\mathcal{O}(T)\) | \(\mathcal{O}(T)\) | \(\mathcal{O}(T)\) | \(\mathcal{O}(1)\) |
| 并行度 | 中等 | 高 | 高 | 完全并行 |
| 梯度计算 | 需要 | 需要 | 不需要 | 不需要 |
| 优势估计 | Critic 基线 | 组内归一化 | 群体排名 | Top-K 选择 |
| 适合规模 | 全规模 | 中小规模 | 全规模 | 大规模 |
RandOpt 的核心优势:当模型规模足够大(进入 Thicket Regime),随机采样即可发现 competitive 的解,无需昂贵的迭代优化。
局限与思考
规模门槛: RandOpt 的优势在大模型上才显现。小模型(<1B)仍然处于”Needle in Haystack”阶段,需要更结构化的搜索。
采样成本: 虽然训练是 \(\mathcal{O}(1)\),但需要评估 \(N\) 个扰动(如 5000 个)。这在计算资源有限时仍是负担。
集成部署: Top-K 集成增加了推理复杂度,蒸馏是可行的解决方案但会损失部分性能。
任务依赖: 并非所有任务都表现出相同的 Thicket 密度。作者发现数学推理任务尤其适用,但其他任务需要具体分析。
总结
Neural Thickets 为我们理解预训练与后训练的关系提供了一个全新视角:
预训练不仅仅是”好的初始化点”,它实际上在参数空间中编码了一个丰富的解分布。
这一发现对 LLM 后训练实践有深远影响:
- 对于大模型,简单的随机采样+选择可能就是足够好的后训练方法
- 计算资源分配可能需要重新思考——与其花大量算力在迭代优化上,不如探索预训练权重的邻域
- 集成方法的价值被重新凸显——Top-K 扰动不仅仅是”候选”,而是真正的”专家”
正如作者所言:
“We view the outcome of pretraining as a distribution over parameter vectors, whose support already contains task-specific experts.”
这可能是后训练领域的一个范式转变的开始。
参考链接: - 论文: https://arxiv.org/abs/2603.12228 - 代码: https://github.com/sunrainyg/RandOpt
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。