Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
一句话结论:这篇论文把信用分配从静态 token 选择改成训练期课程:早期只优化最符合判据的一小部分 token,随后逐步放宽阈值,最终纳入更广的轨迹;最简单有效的版本从答案附近的后缀开始,逐渐向前扩展。
论文信息
- 标题:Not only where, But when: Temporal Scheduling for RLVR
- 作者:Zhang et al.
- 版本:arXiv:2605.25381,2026
- 论文:arXiv:2605.25381
- 定位:training-time schedule、sparse token optimization、trajectory percentile
1. Motivation:静态判据忽略策略会演化
entropy reweighting、high-entropy token selection 等方法都在回答“当前 update 中哪些 token 更重要”,但通常从训练第一步到最后一步使用同一规则。
论文认为这会强迫尚不稳定的策略同时迁就异质行为:开头的推理搭架、中段的探索/反思、末尾的答案实现有不同 entropy 和学习难度。与其一开始全优化,不如先从可靠的下游 continuation 学起,再逐步把信用向更早的 reasoning scaffold 扩展。
2. Method
2.1 通用时间调度
把实际训练进度裁剪到区间 ([{},{}]),得到归一化进度
\[ \bar\tau =\frac{\operatorname{clip}(\tau,\tau_{\mathrm{low}},\tau_{\mathrm{high}}) -\tau_{\mathrm{low}}} {\tau_{\mathrm{high}}-\tau_{\mathrm{low}}}. \]
调度函数 (S(). $$
开始时阈值高,只选最符合 proxy 的 token;随后阈值下降,选中范围扩大。
2.2 Trajectory Percentile Schedule
最简单的 proxy 就是 token 的相对位置:
\[ \mu_t=\frac{t}{T}. \]
对 suffix schedule:
\[ \widehat f_t(\bar\tau) =\mathbb I\left[\frac{t}{T}\ge S(\bar\tau)\right]. \]
它早期只优化靠近答案的后缀,后期逐渐包含前面的推理 token。mask 直接乘进 GRPO 的 token policy gradient。
论文也构造 TP-Score:统计某 token 在轨迹位置区间中的出现频率,用加权平均位置描述其更常出现在前、中还是后段。大规模分析显示三个位置区间的 token 分布和 entropy 动态确实不同。
3. 具体数值推演:8-token 轨迹怎样随训练展开
假设总训练 1000 step,调度只在前 80% 生效:
\[ \tau_{\mathrm{low}}=0,qquad \tau_{\mathrm{high}}=800. \]
使用 linear schedule,response 长度 (T=8)。
3.1 训练 step 200
\[ \bar\tau=\frac{200}{800}=0.25,qquad S=1-0.25=0.75. \]
选择条件是 (t/8),所以只选
\[ t\in\{6,7,8\}. \]
若该 rollout 的 advantage 为 0.6,则前三个被选 token 的有效 policy-gradient 系数都是 0.6,其余五个为 0。
3.2 训练 step 600
\[ \bar\tau=\frac{600}{800}=0.75,qquad S=0.25. \]
现在 (t/8),所以
\[ t\in\{2,3,4,5,6,7,8\}. \]
信用已从答案端扩展到大部分推理链,但第一 token 仍暂不更新。
3.3 训练 step 800 之后
归一化进度被裁剪为 1,(S=0),全部 token 满足条件。训练后期自然回到全序列优化。这个例子展示 temporal scheduling 改的是token 进入优化的时刻,不是终局 reward 本身。
4. Results
论文在 30K 数学训练集上训练 Qwen3-4B/8B,group size 8,评测 in-distribution 数学和 OOD 通用推理。
- Qwen3-4B + GRPO:数学平均 65.3;TP-Schedule 为 67.5(+2.2)。OOD 平均从 64.4 到 67.1(+2.7)。
- Qwen3-8B + GRPO:数学平均 68.0 → 68.8;OOD 69.5 → 70.5。
- GSPO:加入 TP-Schedule 后数学 +0.8、OOD +1.7。
- Entropy Advantage 与 Forking Token 的静态判据加入 schedule 后也有提升,说明方法不是只适配位置 proxy。
- schedule 函数差异较小:linear 在 AIME25/HMMT25/GPQA-d 为 67.1/44.8/60.1,优于无 schedule 的 65.3/41.7/55.6。
- 时间区间有甜点:(_{}=0.8) 最好;延长到 0.95 反而回落。
- 分析显示 schedule 保留了更高的全响应 policy entropy;随机 token schedule 会产生不稳定 gradient spike。
5. 最具创新的点
论文真正的新视角是把 credit allocation 看成一个非平稳训练控制问题。相同的“关键 token”判据不必在整个训练中占同样权重;策略能力变化时,信用选择范围也应演化。这一维度可以包裹在不同 RLVR 算法和 token proxy 外部。
6. 不足与可能改进
6.1 suffix-first 是位置启发式,不是贡献估计
答案附近 token 可能只是复述,早期 token 也可能决定整个解题方向。可用 verifier confidence、flow、entropy 与位置的联合课程,而不是固定 suffix。
6.2 因果机制仍不清楚
更高 entropy 与更好准确率同时出现,不证明 entropy preservation 是收益原因。需要控制相同 token budget、相同梯度范数的对照实验。
6.3 schedule 增益依赖训练阶段定义
总 step、数据难度或有效 token 数变化时,固定 0.8 可能不再合适。可根据 validation plateau、entropy 或 mask 覆盖率自适应停止调度。
6.4 early mask 会丢弃大量 on-policy 数据
虽然算过 rollout,这些 token 早期不贡献梯度,可能造成样本浪费。可对未选 token 使用较小而非零权重,或把节省的 backward 预算换成更多 rollout。
6.5 实验集中于数学
位置语义在代码、对话和 Agent tool-call 中不同;“越靠后越可靠”未必成立。Agent 场景更适合按 plan/act/verify 角色做 temporal schedule。
7. 阅读结论
Temporal Scheduling 不是新的 credit estimator,而是 estimator 的训练期编排器。它提供了一个低成本、可组合的想法:不要只问 token 该不该学,还要问策略在现在这个阶段是否已经准备好从它学习。
参考入口
- TP-Score 与策略行为:第 2 节、第 3.1 节
- 调度公式:第 3.2–3.3 节,式 (6)–(10)
- 主实验与消融:第 4 节,表 1–3、图 3–4
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。