Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token

一句话结论:这篇论文把信用分配从静态 token 选择改成训练期课程:早期只优化最符合判据的一小部分 token,随后逐步放宽阈值,最终纳入更广的轨迹;最简单有效的版本从答案附近的后缀开始,逐渐向前扩展。

论文信息

  • 标题:Not only where, But when: Temporal Scheduling for RLVR
  • 作者:Zhang et al.
  • 版本:arXiv:2605.25381,2026
  • 论文arXiv:2605.25381
  • 定位:training-time schedule、sparse token optimization、trajectory percentile

1. Motivation:静态判据忽略策略会演化

entropy reweighting、high-entropy token selection 等方法都在回答“当前 update 中哪些 token 更重要”,但通常从训练第一步到最后一步使用同一规则。

论文认为这会强迫尚不稳定的策略同时迁就异质行为:开头的推理搭架、中段的探索/反思、末尾的答案实现有不同 entropy 和学习难度。与其一开始全优化,不如先从可靠的下游 continuation 学起,再逐步把信用向更早的 reasoning scaffold 扩展。

2. Method

2.1 通用时间调度

把实际训练进度裁剪到区间 ([{},{}]),得到归一化进度

\[ \bar\tau =\frac{\operatorname{clip}(\tau,\tau_{\mathrm{low}},\tau_{\mathrm{high}}) -\tau_{\mathrm{low}}} {\tau_{\mathrm{high}}-\tau_{\mathrm{low}}}. \]

调度函数 (S(). $$

开始时阈值高,只选最符合 proxy 的 token;随后阈值下降,选中范围扩大。

2.2 Trajectory Percentile Schedule

最简单的 proxy 就是 token 的相对位置:

\[ \mu_t=\frac{t}{T}. \]

对 suffix schedule:

\[ \widehat f_t(\bar\tau) =\mathbb I\left[\frac{t}{T}\ge S(\bar\tau)\right]. \]

它早期只优化靠近答案的后缀,后期逐渐包含前面的推理 token。mask 直接乘进 GRPO 的 token policy gradient。

论文也构造 TP-Score:统计某 token 在轨迹位置区间中的出现频率,用加权平均位置描述其更常出现在前、中还是后段。大规模分析显示三个位置区间的 token 分布和 entropy 动态确实不同。

3. 具体数值推演:8-token 轨迹怎样随训练展开

假设总训练 1000 step,调度只在前 80% 生效:

\[ \tau_{\mathrm{low}}=0,qquad \tau_{\mathrm{high}}=800. \]

使用 linear schedule,response 长度 (T=8)。

3.1 训练 step 200

\[ \bar\tau=\frac{200}{800}=0.25,qquad S=1-0.25=0.75. \]

选择条件是 (t/8),所以只选

\[ t\in\{6,7,8\}. \]

若该 rollout 的 advantage 为 0.6,则前三个被选 token 的有效 policy-gradient 系数都是 0.6,其余五个为 0。

3.2 训练 step 600

\[ \bar\tau=\frac{600}{800}=0.75,qquad S=0.25. \]

现在 (t/8),所以

\[ t\in\{2,3,4,5,6,7,8\}. \]

信用已从答案端扩展到大部分推理链,但第一 token 仍暂不更新。

3.3 训练 step 800 之后

归一化进度被裁剪为 1,(S=0),全部 token 满足条件。训练后期自然回到全序列优化。这个例子展示 temporal scheduling 改的是token 进入优化的时刻,不是终局 reward 本身。

4. Results

论文在 30K 数学训练集上训练 Qwen3-4B/8B,group size 8,评测 in-distribution 数学和 OOD 通用推理。

  • Qwen3-4B + GRPO:数学平均 65.3;TP-Schedule 为 67.5(+2.2)。OOD 平均从 64.4 到 67.1(+2.7)。
  • Qwen3-8B + GRPO:数学平均 68.0 → 68.8;OOD 69.5 → 70.5。
  • GSPO:加入 TP-Schedule 后数学 +0.8、OOD +1.7。
  • Entropy AdvantageForking Token 的静态判据加入 schedule 后也有提升,说明方法不是只适配位置 proxy。
  • schedule 函数差异较小:linear 在 AIME25/HMMT25/GPQA-d 为 67.1/44.8/60.1,优于无 schedule 的 65.3/41.7/55.6。
  • 时间区间有甜点:(_{}=0.8) 最好;延长到 0.95 反而回落。
  • 分析显示 schedule 保留了更高的全响应 policy entropy;随机 token schedule 会产生不稳定 gradient spike。

5. 最具创新的点

论文真正的新视角是把 credit allocation 看成一个非平稳训练控制问题。相同的“关键 token”判据不必在整个训练中占同样权重;策略能力变化时,信用选择范围也应演化。这一维度可以包裹在不同 RLVR 算法和 token proxy 外部。

6. 不足与可能改进

6.1 suffix-first 是位置启发式,不是贡献估计

答案附近 token 可能只是复述,早期 token 也可能决定整个解题方向。可用 verifier confidence、flow、entropy 与位置的联合课程,而不是固定 suffix。

6.2 因果机制仍不清楚

更高 entropy 与更好准确率同时出现,不证明 entropy preservation 是收益原因。需要控制相同 token budget、相同梯度范数的对照实验。

6.3 schedule 增益依赖训练阶段定义

总 step、数据难度或有效 token 数变化时,固定 0.8 可能不再合适。可根据 validation plateau、entropy 或 mask 覆盖率自适应停止调度。

6.4 early mask 会丢弃大量 on-policy 数据

虽然算过 rollout,这些 token 早期不贡献梯度,可能造成样本浪费。可对未选 token 使用较小而非零权重,或把节省的 backward 预算换成更多 rollout。

6.5 实验集中于数学

位置语义在代码、对话和 Agent tool-call 中不同;“越靠后越可靠”未必成立。Agent 场景更适合按 plan/act/verify 角色做 temporal schedule。

7. 阅读结论

Temporal Scheduling 不是新的 credit estimator,而是 estimator 的训练期编排器。它提供了一个低成本、可组合的想法:不要只问 token 该不该学,还要问策略在现在这个阶段是否已经准备好从它学习。

参考入口

  • TP-Score 与策略行为:第 2 节、第 3.1 节
  • 调度公式:第 3.2–3.3 节,式 (6)–(10)
  • 主实验与消融:第 4 节,表 1–3、图 3–4

Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
https://kissshhot.github.io/2026/08/20/temporal-scheduling-rlvr/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。