SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用

一句话结论:SCRL 不先发明更复杂的 credit estimator,而是改变训练任务:把一道难题变成四个递进、可独立验证的子问题,在 rollout group 内按子问题位置分别归一化 reward,再把 advantage 只分给对应答案 span。

论文信息

  • 标题:From Reasoning Chains to Verifiable Subproblems: SCRL Enables Credit Assignment for LLM Reasoning
  • 作者:Jiang et al.
  • 版本:arXiv:2605.22074,2026
  • 论文arXiv:2605.22074
  • 定位:subproblem curriculum、RLVR、gradient dead zone、span credit

1. Motivation:难题上 GRPO 为什么没有梯度

能力边界上的题最值得训练,却最容易让一个 rollout group 全部答错。二值 reward 全为 0 时,group-normalized advantage 也全为 0。失败答案中已经完成的正确中间推导完全无法被利用。

论文将其称为 gradient dead zone:若当前策略解出问题 (x) 的概率 (p(x;)<),直接 outcome RLVR 的有效梯度信息随 () 退化。核心问题不是 verifier 不准,而是可验证事件发生得太晚、太少

2. Method 全流程

2.1 从 reference reasoning chain 构造课程

外部 LLM 根据已有 reference solution 生成 (K) 个子问题:

\[ s^{(1)}\prec s^{(2)}\prec\cdots\prec s^{(K)}=x. \]

它们需要:

  1. 难度递增;
  2. 相互衔接但各自是完整问题;
  3. 每个答案都可自动验证;
  4. 最后一个子问题严格等于原题。

主实验取 (K=4)。模型在一次 on-policy rollout 中按顺序回答全部子问题,并用 <p1>...</p1> 等标签界定各答案 token span。

2.2 Progress-aware correction

第 (i) 条 rollout 的原始子问题奖励为

\[ \mathbf r_i=(r_i^{(1)},\ldots,r_i^{(K)})\in\{0,1\}^K. \]

定义从开头连续答对的最大长度

\[ k_i=\max\{j\in\{0,\ldots,K\}\mid r_i^{(1)}=\cdots=r_i^{(j)}=1\}. \]

只保留最长正确前缀:

\[ \widetilde r_i^{(j)}= \begin{cases} r_i^{(j)},&j\le k_i,\\ 0,&j>k_i. \end{cases} \]

所以 ([1,1,0,1]) 会被改为 ([1,1,0,0])。这防止模型跳过早期子问题、碰巧答对后题来骗取信用。

2.3 每个子问题位置单独归一化

对 group 中固定位置 (j):

\[ A_i^{(j)} =\frac{\widetilde r_i^{(j)} -\operatorname{mean}(\{\widetilde r^{(j)}\})} {\operatorname{std}(\{\widetilde r^{(j)}\})}. \]

若 token (t) 位于第 (j) 个答案 span,就令 (A_{i,t}=A_i^{(j)});span 外 token 为 0。这样不同阶段的进展不会被一个总 reward 混在一起。

2.4 Mixed-group training

只训练 curriculum prompt 会造成测试时 prompt mismatch。SCRL 对每个问题用一半预算采样 curriculum rollout,另一半直接回答原题并使用标准 GRPO,再在同一次 update 中优化两部分。

3. 具体数值推演:四条 rollout、四个子问题

假设四条 curriculum rollout 的 raw reward 为

\[ \begin{aligned} \mathbf r_1&=[1,1,0,1],\\ \mathbf r_2&=[1,0,1,1],\\ \mathbf r_3&=[1,1,1,1],\\ \mathbf r_4&=[0,1,1,1]. \end{aligned} \]

3.1 前缀校正

最长连续进展为 (k=[2,1,4,0]),所以

\[ \begin{aligned} \widetilde{\mathbf r}_1&=[1,1,0,0],\\ \widetilde{\mathbf r}_2&=[1,0,0,0],\\ \widetilde{\mathbf r}_3&=[1,1,1,1],\\ \widetilde{\mathbf r}_4&=[0,0,0,0]. \end{aligned} \]

注意第一条 rollout 最后原本答对,仍因第三题先失败而不计信用。

3.2 位置 1 的 advantage

第一列是 ([1,1,1,0]),均值 0.75、总体标准差约 0.433:

\[ A^{(1)}\approx[0.577,0.577,0.577,-1.732]. \]

3.3 位置 2 的 advantage

第二列 ([1,0,1,0]),均值 0.5、标准差 0.5:

\[ A^{(2)}=[1,-1,1,-1]. \]

3.4 位置 3 和 4

两列都是 ([0,0,1,0]),均值 0.25、标准差约 0.433:

\[ A^{(3)}=A^{(4)} \approx[-0.577,-0.577,1.732,-0.577]. \]

因此 rollout 1 的四个答案 span 依次得到

\[ [0.577,1,-0.577,-0.577]. \]

它前两个已掌握的部分得到正学习信号;失败后的答案不再因偶然正确而获奖。这是 SCRL 将“部分进展”转成 token gradient 的完整链路。

4. 理论直觉

论文用 effective gradient information matrix 分析:原题成功概率接近 0 时,outcome group 几乎总是全同 reward,信息矩阵退化。若各子问题在 curriculum 条件下的成功概率落在 ([p^,1-p^]),子问题 product manifold 的最小特征值仍有正下界,且相对原问题的恢复比是 ((1/))。

这不是说任意拆题都保证成功;前提是子问题确实处在可探索、可验证且条件可识别的区域。

5. 实验结果

训练集是 1,024 道高难竞赛数学题,主设置用 DeepSeek-V3.2 从 reference solution 生成四个子问题,训练 300 steps。

  • Qwen3-4B:GRPO 七基准平均 30.9,SCRL 35.0(+4.1);AIME25 从 7.2 到 15.3,AMC 从 46.1 到 52.4。
  • Qwen3-14B:GRPO 36.4,SCRL 38.3(+1.9)。
  • Llama3.2-3B:GRPO 15.7,SCRL 16.4,提升较小但仍最高。
  • 用较弱 Qwen3-4B-Instruct 生成子问题,SCRL 平均 43.0;DeepSeek-V3.2 生成时 44.2,均高于对应 GRPO 40.3。
  • credit 消融:Both-GRPO 43.9;不做前缀 correction 的 subproblem normalization 41.9;完整方法 44.2。
  • (K=2,3,4) 的平均分为 41.8、42.8、44.2;更多子问题让更多 rollout 至少取得一步进展。

6. 最具创新的点

SCRL 最创新的是把 credit assignment 的难点从“怎样猜每个 token 的贡献”转为“怎样设计更多可验证的中间事件”。它通过结构化响应 span 精确对齐 reward 与 token,又用前缀 correction 约束 curriculum 的因果顺序。

7. 不足与可能改进

7.1 依赖 reference solution 与外部 LLM

开放任务可能没有标准推理链,离线生成也有额外成本。可研究由当前策略自提议子目标,再用独立 verifier 筛选。

7.2 错误子问题会形成信用闸门

一个含糊或答案错误的早期子问题会把后续全部信用清零。需要对子问题做自动一致性、可解性和依赖关系验证,或允许带置信度的软前缀。

7.3 只适合可验证任务

数学非常适合 exact-match / symbolic verifier;创作、对话、研究 Agent 的中间结果难以客观验证。可以使用 test execution、环境 predicate 或校准 judge,但证据强度会下降。

7.4 课程 prompt 与真实推理分布不同

mixed-group 缓解但不消除 prompt mismatch;模型可能学会依赖明确子问题提示。应报告只给原题时的推理结构迁移,并测试去除标签后的鲁棒性。

7.5 成本公平性

一次 curriculum rollout 含四个问题,token 和 verifier 次数与 GRPO 不同。论文提供数据规模对照,但未来仍应做严格 token/FLOP/verifier-budget parity。

8. 阅读结论

SCRL 说明:当直接 RLVR 没有信用时,最有效的办法之一不是更精细地解释一次失败,而是把目标改写为一串策略当前有机会完成的、可验证的里程碑。它特别适合有 reference solution 和可靠 verifier 的难推理任务。

参考入口

  • 子问题与 progress correction:第 3.2 节,式 (2)–(3)
  • span advantage 与 mixed training:式 (4)–(5)
  • 理论:第 4 节,Theorem 4.2–4.3
  • 实验与消融:第 5 节、附录 A

SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用
https://kissshhot.github.io/2026/08/20/scrl-curriculum-rl-credit/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。