On-Policy Distillation:让学生在自己的轨迹上向老师学习
On-Policy Distillation(OPD)正在成为 LLM 后训练的核心范式之一。Qwen3、MiMo、GLM-5 等主流模型都已将其纳入后训练流水线,而 2026 年 4 月密集发布的综述和分析论文,则标志着这个领域从”散点式探索”走向系统化成熟。
本文基于以下几篇代表性工作,系统梳理 OPD 的核心思路、方法分类、机制分析和实践建议: - A Survey of On-Policy Distillation for Large Language Models - Rethinking On-Policy Distillation: Phenomenology, Mechanism, and Recipe - Self-Distilled Reasoner - Black-Box On-Policy Distillation (GAD)
问题的起点:离线蒸馏的曝光偏差
传统知识蒸馏(Off-Policy Distillation)的做法很直观:让强大的教师模型生成一批高质量数据,然后用这些数据对学生模型做监督微调(SFT)。
但这里有个根本性矛盾:
- 训练时,学生在”老师的输出”上学习
- 推理时,学生需要基于自己生成的 token 继续自回归
这个 train-test 不一致,即曝光偏差(Exposure Bias),会让早期错误在自回归中不断被放大。理论上,误差累积的上界随序列长度 \(T\) 以 \(O(T^2)\) 增长——序列越长,灾难越大。
On-Policy Distillation 的核心修复:
让学生自己生成轨迹,然后让老师在这些轨迹上提供逐 token 的密集监督信号。这样,学生学到的是”在自己可能走到的状态上如何改进”,误差累积降为 \(O(T)\)。
统一的数学框架
尽管各种 OPD 方法看起来五花八门,综述论文揭示了一个统一的目标函数:
\[\mathcal{L}_{\text{OPD}}(\theta) = \mathbb{E}_{y \sim \pi_{\text{mix}}} \left[ \sum_t D_f\left( p_T(\cdot \mid y_{<t}),\ p_\theta(\cdot \mid y_{<t}) \right) \right]\]
其中: - \(\pi_{\text{mix}}\) 是行为采样策略(可以是学生、老师、或两者的混合) - \(D_f\) 是某种 f-散度(KL、Reverse KL、Jensen-Shannon 等) - \(p_T\) 是教师模型,\(p_\theta\) 是学生模型
GKD、MiniLLM、DistiLLM 等经典方法,本质上只是在采样策略、散度选择和参数顺序上有所不同——底层是同一套框架。
三维分类体系
综述从三个正交维度对 OPD 方法进行分类:
维度一:反馈信号类型
| 类型 | 含义 | 代表方法 |
|---|---|---|
| 基于 logit | 教师输出 token 级概率分布 | GKD, MiniLLM, DistiLLM |
| 基于结果 | 标量奖励或偏好信号 | KETCHUP, CMDP 变体 |
| 自对弈 | 学生自身演化策略 | SPIN, SDPO |
维度二:教师访问权限
| 类型 | 含义 | 代表方法 |
|---|---|---|
| 白盒 | 可访问完整概率分布 | MiniLLM, DistiLLM-2 |
| 黑盒 | 仅 API 文本输出 | GAD, OVD |
| 无外部教师 | 自蒸馏 | SPIN, OPSD |
维度三:损失粒度
- Token 级:每一步即时反馈,信号密集但计算量大
- 序列级:生成结束后给奖励,类似 RL 的稀疏奖励
- 混合/自适应:结合两者,动态切换
散度选择的核心权衡
OPD 中一个反复出现的问题是:用 Forward KL 还是 Reverse KL?
\[D_{\text{KL}}(p_T \| p_\theta) \quad \text{vs} \quad D_{\text{KL}}(p_\theta \| p_T)\]
- Forward KL(mode-covering):学生被迫覆盖老师的所有高概率区域。适合开放生成场景,保留多样性,但有产生幻觉的风险。
- Reverse KL(mode-seeking):学生找到老师概率高的某个模式全力对齐。适合数学推理等”决策性”任务,但可能丢失多样性(模式坍缩)。
前沿工作如 Entropy-Aware OPD 走向自适应:根据教师在当前上下文的置信度,动态在两者之间切换——高置信时用 Reverse KL 精准对齐,低置信时用 Forward KL 保持多样。
机制洞察:OPD 究竟在优化什么?
论文 Rethinking On-Policy Distillation 做了深入的 token 级机制分析,揭示了两个关键发现:
发现一:Token 重叠度是成功的核心指标
在成功的 OPD 训练中,学生与老师 top-k token 集合的重叠率从训练初期的 72% 稳步上升到 91%;而失败的训练中,这个重叠率几乎停滞。
更关键的是:97-99% 的概率质量集中在重叠 token 上。只对重叠 token 做优化,效果与完整 top-k 对齐相当;非重叠 token 对梯度贡献微乎其微。
这意味着 OPD 的本质是:在学生和老师都认为”高概率”的 token 上,推动学生向老师靠拢。
发现二:两个成功的必要条件
思维模式一致性(Thinking-Pattern Consistency)
学生和老师必须共享兼容的推理模式。论文中有一个反直觉的实验:用 GRPO 训练的较弱老师,反而比更强的”非思维”老师蒸馏效果更好——因为前者的推理模式与学生更兼容。
老师的绝对性能,不等于蒸馏效果。模式对齐才是关键。
新知识供给(New Knowledge Requirement)
老师必须提供学生在训练数据中未见过的能力。同一 pipeline 的老师几乎没有增益;经过后训练的老师则带来显著提升。甚至出现了”反向蒸馏”(用弱老师蒸馏强学生)与”正向蒸馏”(用强老师蒸馏弱学生,但老师来自同一家族)表现相同的案例——证明训练动态完全可以独立于老师的基准性能。
几个代表性方法
MiniLLM:把蒸馏重构为策略梯度 RL
MiniLLM 将教师 log 概率作为轨迹奖励,用 REINFORCE 更新学生策略。这建立了蒸馏与 RL 之间的桥梁,也引出了后续关于”OPD 是 KL 约束 RL 的特例”这一理论统一。
SDPO:无外部教师的自蒸馏
Self-Distillation Policy Optimization 利用可验证环境的文本反馈(如运行时错误、评判结果),将其转化为密集学习信号——无需任何外部教师或奖励模型。SDPO 还支持推理时自蒸馏:生成多条候选解,筛选高质量回答后复用为 demonstration,迭代优化输出。
GAD:黑盒场景下的对抗蒸馏
Generative Adversarial Distillation 针对只能通过 API 访问专有教师的场景。将学生视为生成器,训练一个判别器区分学生与教师的输出,构成 minimax 博弈。判别器充当与学生协同演化的在线奖励模型,提供稳定的自适应反馈。
超越教师:奖励外推
Yang et al. (2026) 从理论上证明,OPD 中教师的逐 token log-ratio 构成一个隐式奖励,将这个奖励的权重放大到标准值以上,可以将学生性能推过教师的性能边界——即真正意义上超越老师。
与 SFT 和 RL 的对比
| Off-Policy SFT | RL(如 GRPO) | On-Policy Distillation | |
|---|---|---|---|
| 学习信号 | 教师数据(固定) | 稀疏标量奖励 | 教师在学生轨迹上的密集信号 |
| 曝光偏差 | 严重(\(O(T^2)\)) | 无 | 轻微(\(O(T)\)) |
| 信用分配 | 容易 | 困难 | 容易(token 级) |
| 计算成本 | 低 | 高 | 中(估计比 RL 低 10-100x) |
| 需要教师 | 离线数据即可 | 不需要 | 需要在线查询 |
OPD 本质上是把 RL 的在线性与蒸馏的密集性结合,在计算成本和效果之间取得了良好平衡。
实践建议
根据约束条件选择方法:
- 白盒教师 + 推理任务:优先考虑 Entropy-Aware OPD 或 DistiLLM-2(自适应散度)
- 黑盒 API 教师:GAD 或 OVD(语言级蒸馏)
- 无外部教师:SPIN、OPSD 或基于特权信息的自蒸馏
- 计算受限:Fast OPD(前缀复用)或混合 token/序列方法
冷启动建议:如果学生和目标教师的思维模式差异较大,先用教师数据做 off-policy SFT 热身,再切换到 OPD。实验表明,这能有效提升初始 token 重叠率,避免早期训练陷入失败模式。
开放问题
OPD 仍有不少值得探索的方向:
- 蒸馏 Scaling Laws:性能如何随教师规模、学生容量、数据量变化?
- 不确定性感知反馈:如何让学生自适应地信任/怀疑教师在不同上下文的信号?
- 动态课程设计:采样策略应随学生进步而演化,而非静态固定
- 多轮 Agent 蒸馏:当前方法主要针对单轮生成,多轮环境交互场景几乎空白
- 多模态 OPD:如何扩展到视觉语言模型、语音模型?
小结
On-Policy Distillation 的核心思想并不复杂:让学生在自己的轨迹上向老师学习,而不是被动模仿老师的轨迹。这一改动消除了曝光偏差,让密集的 token 级监督信号真正作用在学生实际会遭遇的状态上。
机制研究告诉我们,OPD 成功的关键不是”教师有多强”,而是”教师与学生是否说同一种语言”——共享的思维模式和真正新颖的知识,才是蒸馏增益的来源。
随着 Qwen3、MiMo 等头部模型将其纳入标准后训练流程,OPD 已经从学术探索走向工业实践。理解它的原理,对于接下来几年的 LLM 后训练工作,几乎是必修课。
参考文献
- A Survey of On-Policy Distillation for Large Language Models (arXiv 2604.00626)
- Rethinking On-Policy Distillation of Large Language Models (arXiv 2604.13016)
- Self-Distilled Reasoner (arXiv 2601.18734)
- Black-Box On-Policy Distillation via GAD (arXiv 2511.10643)
- Reinforcement Learning via Self-Distillation (SDPO) (arXiv 2601.20802)
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。