SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO

一句话结论:SPPO 不再要求 critic 给几千个推理 token 分别估值,而是把“prompt → 完整回复 → 终局奖励”看成一步上下文赌博机,只预测题目本身的可解概率,再把同一个序列级优势广播给整条回复。它以单条采样保留 PPO 的样本效率,在论文实验中超过标准 PPO,并以约 5.9 倍训练加速达到 GRPO 的峰值表现。

论文信息

  • 标题:SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
  • 作者:Tianyi Wang、Yixia Li、Long Li 等
  • arXiv2604.08865
  • PDF论文全文
  • 代码sustech-nlp/SPPO
  • 版本:arXiv v1,2026-04-10;ACL 2026 Main

下文公式编号与论文一致。数值推演是我构造的教学用简化例子,不是论文中的训练样本。

1. 论文全景

RLVR(Reinforcement Learning with Verifiable Rewards)通常只在整段推理结束时给一个二元奖励。标准 PPO 却把生成过程写成 token 级 MDP,并训练 token 级 critic (V(s_t)) 配合 GAE 分配信用。链条一长,稀疏奖励要跨几千步传播,critic 又容易在答案附近利用位置或语义捷径,最终出现论文所谓的 Tail Effect:正确轨迹尾部的价值过早接近 1,使优势消失;错误轨迹的中间错误又得不到及时惩罚。

GRPO 绕开了 token 级 critic,但每道题要采样多条回复才能计算组内基线。SPPO 的核心折中是:

  1. 把 prompt (s_p) 当作上下文;
  2. 把完整回复 (a_{mathrm{seq}}=(y_1,ldots,y_T)) 当作一个原子动作;
  3. 用标量 value model (V_(s_p)) 估计当前策略解对该题的概率;
  4. 只采样一条回复,用 (A=R-V_(s_p)) 得到序列级优势;
  5. 保留 PPO 的 token 概率比与 clipping,但将同一个 (A) 广播到所有 token。

因此,SPPO 不是更细粒度地寻找“哪一步推理最关键”,而是主动放弃时间信用分解,换取长程稀疏奖励下更稳定、更便宜的优化。

2. Motivation:PPO 与 GRPO 各自卡在哪里

2.1 标准 PPO 的长程信用分配偏差

PPO 的 clipped surrogate 为

\[ J_{\mathrm{PPO}}(\theta)= \mathbb E_t\left[ \min\left( r_t(\theta)\hat A_t, \operatorname{clip}(r_t(\theta),1-\epsilon,1+\epsilon)\hat A_t \right) \right], \]

其中 (r_t()=(a_ts_t)/{_k}(a_ts_t))。标准 PPO 用

\[ \delta_t=r_t+\gamma V(s_{t+1})-V(s_t), \qquad \hat A_t^{\mathrm{GAE}}= \sum_{l=0}^{T-t-1}(\gamma\lambda)^l\delta_{t+l}. \]

在只有终局奖励的推理任务里,常取 (gamma=),于是

\[ \hat A_t^{\mathrm{GAE}}=G_t-V(s_t). \]

难点不是公式不能算,而是 critic 必须对大量“只差一个前缀”的中间文本状态稳定估值。论文图 1 观察到:critic 的判别能力主要集中在序列尾部,信用更像按位置而非语义贡献分配。

2.2 GRPO 稳定,但多采样昂贵

GRPO 对同一 prompt 采样 (N) 条回复,以组均值和标准差构造

\[ \operatorname{Adv}(s_p,a)=\frac{R-\mu_g}{\sigma_g}. \]

若把正确与否看成成功率为 (hat p(s_p)) 的 Bernoulli 变量,论文推导出

\[ \operatorname{Adv}(s_p,a)= \begin{cases} \sqrt{\dfrac{1-\hat p(s_p)}{\hat p(s_p)}}, & R=1,\\[6pt] -\sqrt{\dfrac{\hat p(s_p)}{1-\hat p(s_p)}}, & R=0. \end{cases} \]

这说明 GRPO 已经在隐式做序列级上下文赌博机:整条回复共用一个与题目难度相关的优势。问题是 (hat p) 来自组内 Monte Carlo 样本,要降低方差就必须多生成。

3. Method:SPPO 如何工作

3.1 从 token 级 MDP 改写为序列级上下文赌博机

SPPO 将时域概念性地折叠为 (H=1):

  • 上下文:静态 prompt (s_p);
  • 动作:完整回复 (a_{mathrm{seq}});
  • 奖励:验证器给出的 (R=r(s_p,a_{mathrm{seq}}){0,1})。

标量 value model 不再读取任意中间前缀,只回答“当前策略解对这道题的概率有多大”。

3.2 标量 value model 与序列级优势

论文式(1)定义

\[ A(s_p,a)=R-V_\phi(s_p). \]

value model 用二元交叉熵训练(论文式 2):

\[ L_V(\phi)= -\mathbb E\left[ R\log V_\phi(s_p)+(1-R)\log(1-V_\phi(s_p)) \right]. \]

它是 prompt-dependent baseline:难题预测值低,偶然成功会得到更强正优势;容易题预测值高,意外失败会得到更强负优势。

3.3 保留 PPO clipping,将优势广播给所有 token

SPPO 的策略目标为论文式(3):

\[ J_{\mathrm{SPPO}}(\theta)= \mathbb E_{s_p\sim D,a\sim\pi_{\theta_k},t\in a} \left[ \min\left( r_t(\theta)A(s_p,a), \operatorname{clip}(r_t(\theta),1-\epsilon,1+\epsilon)A(s_p,a) \right) \right]. \]

概率比仍逐 token 计算,所以更新仍能受 clipping 保护;变化只在优势项:标准 PPO 的 (hat A_t) 被统一的 (A(s_p,a)) 取代。

训练时需要 policy rollout、终局验证器和 scalar critic;推理时仍只使用 policy,value model 不增加部署开销。由于标量估值比生成推理简单,论文还允许 critic decoupling:7B policy 可搭配 1.5B critic。

4. 具体数值例子:单条回复如何完成一次 SPPO 更新

设一道数学题的 prompt 为 (s_p),value model 预测

\[ V_\phi(s_p)=0.65. \]

policy 只采样一条三 token 的简化回复,验证器判定答案正确,所以 (R=1)。

第 1 步:算序列级优势与 critic 损失

\[ A=R-V_\phi(s_p)=1-0.65=0.35. \]

这一个 (0.35) 会广播给三个 token。critic 的 BCE 损失为

\[ L_V=-\log 0.65\approx 0.4308. \]

若同一题生成失败,则 (A=0-0.65=-0.65),惩罚强于此次成功的奖励,符合“模型本来认为这题较容易”的直觉。

第 2 步:逐 token 计算概率比并 clipping

设新旧策略的概率比分别为

\[ (r_1,r_2,r_3)=(1.10,1.35,0.75), \]

取 (epsilon=0.2),裁剪区间为 ([0.8,1.2])。三个 token 的 surrogate 分别是:

\[ \ell_1=\min(1.10\times0.35,1.10\times0.35)=0.385, \]

\[ \ell_2=\min(1.35\times0.35,1.20\times0.35) =\min(0.4725,0.42)=0.42, \]

\[ \ell_3=\min(0.75\times0.35,0.80\times0.35) =\min(0.2625,0.28)=0.2625. \]

平均目标为

\[ J_{\mathrm{SPPO}} =\frac{0.385+0.42+0.2625}{3} \approx0.3558. \]

第 2 个 token 的概率已经增长过快,正向收益被封顶;第 3 个 token 的概率下降,仍获得将其拉回的正向梯度。整个过程只用了一条 rollout,也没有估计任何中间前缀的价值。

这个例子省略了什么

真实回复会有成千上万 token,目标会在 batch 上平均,value model 与 policy 分别优化;但“每条回复一个 (A)、每个 token 一个概率比、统一 clipping”的对应关系不变。

5. Results:实验支持了什么

论文在 DeepSeek-R1-Distill-Qwen-1.5B 与 7B 上训练,使用 DeepScaleR 或 DAPO-17K,评测 AIME24、AIME25、AMC23、MATH500、Minerva Math 的 Average@16;GRPO 使用 (N=8),SPPO 使用 (N=1)。

5.1 主结果

  • 1.5B:SPPO 平均分 48.06,GRPO 为 47.08,绝对提升 0.98;标准 PPO 为 44.06。
  • 7B:SPPO 为 58.11,GRPO 为 57.44,绝对提升 0.67;标准 PPO 为 56.44。
  • 7B policy + 1.5B critic:平均分进一步达到 58.56,是表 1 最佳配置。
  • 1.5B 上标准 PPO 甚至低于 base model(44.06 vs. 44.96),说明 token 级 GAE 在该设置下不是“提升少”,而是发生了退化。

5.2 效率、显存与校准

  • SPPO 约 22 小时达到平均分约 58,并以论文报告的 5.9× speedup匹配 GRPO 峰值表现;核心来源是 (N=1) 而非 (N=8)。
  • 7B policy 搭配 1.5B critic 的归一化峰值显存为 78.7%,7B critic 配置为 91.5%,绝对降低 12.8 个百分点
  • 在 200 个验证 prompt 上,critic 预测与经验 Avg@64 的 Pearson 相关系数为 0.642,Spearman 为 0.664。它能排序题目难度,但预测分布集中在 0.6–0.7,校准仍偏保守。

5.3 消融与控制实验

把 BCE 损失直接塞回 token 级 PPO(PPO + BCE)仍在约 500 步发生性能坍塌,说明收益不是换了 critic loss,而是来自序列级建模与统一优势。论文还把五个经典控制任务改造成长时域、确定转移、仅终局二元奖励的 RLVR 测试床;SPPO 在 Hopper、MountainCar 等标准 PPO 失败的任务上保持收敛,为“问题来自长程稀疏信用传播”提供了跨 LLM 的控制证据。

这些实验支持“序列级 baseline 更适合结果可验证的长程任务”,但不支持“序列级奖励能识别回复内部真正有因果贡献的步骤”。SPPO 是稳定地奖惩整条链,而不是精确的过程信用分配器。

6. 最具创新性的点

最有价值的不是又写了一个 PPO 变体,而是把 GRPO 的成功重新解释为隐式序列级上下文赌博机,然后显式学习 prompt-level baseline,拆开了两个常被捆绑的选择:

  • 要序列级稳定性,不等于必须做组内多采样;
  • 要 learned critic,不等于必须估计每个 token 前缀的价值。

这个重构同时解释了方法、效率和小 critic 为什么成立。PPO + BCE 的失败、(N=1) 的训练速度以及 1.5B critic 对 7B policy 的有效性,是最直接的证据链。

7. 不足与可能的改进

7.1 作者明确承认的局限

论文主要面向有客观验证器的 RLVR。开放式写作、对话质量与主观偏好没有可靠二元标签,prompt solvability 也难以定义,因此结论不能直接外推到通用 RLHF。

改进方向:将 (R{0,1}) 扩展为带不确定性的分布式奖励,并联合校准 reward model 与 value model;需要在人类偏好集上同时报告校准误差、胜率和 reward hacking 指标。代价是 baseline 会继承奖励模型偏差。

7.2 我的分析:整条回复同奖同罚,仍然粗粒度

失败可能只源于最后一步算术错误,SPPO 却惩罚此前所有正确推理;成功也可能包含大量无效绕路。它消除了时间传播噪声,却没有恢复步骤级因果信用。

改进方向:采用“序列级 baseline + 少量可验证段级边界”的分层优势:全局 (A_{}) 保稳定,局部 verifier 只在能可靠验证的步骤上做残差修正。应比较最终正确率、推理长度、错误步骤定位精度和梯度方差,防止重新引入 token critic 的不稳定。

7.3 我的分析:value model 的在线校准证据不够完整

相关系数说明能排序难度,不等于概率校准良好;图 7 的预测集中于 0.6–0.7,且 policy 持续更新时目标成功率也在漂移。

改进方向:引入滚动 calibration buffer、温度缩放或 ensemble uncertainty,并报告 ECE、Brier score 以及不同训练阶段的校准漂移。更强校准会增加额外采样和维护成本。

7.4 我的分析:公平效率比较仍混有系统变量

论文公开了 verl 配置,也增加了控制任务,但主实验中不同方法的 batch、rollout 数和墙钟吞吐天然不同;“5.9×”更接近端到端配置结果,不是纯算法复杂度定理。

改进方向:补充等 token 预算、等 optimizer step、等 GPU-hour 三套曲线,并报告生成、critic、更新各阶段耗时。这样能区分“少采样”与实现优化各自贡献。

8. 读者应记住的要点

  • SPPO 的核心对象是 (V(s_p)),而不是 (V(s_t)):预测题目可解性,不预测每个中间前缀。
  • 它用单样本 (A=R-V(s_p)) 替代 GRPO 的组内 baseline,同时保留 PPO clipping。
  • 论文证明了长程 RLVR 中“序列级稳定性”可以和“单样本吞吐”兼得。
  • 最大成立条件是奖励必须可验证;最大风险是统一优势过于粗粒度,无法区分正确链中的噪声与错误链中的有效步骤。

SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
https://kissshhot.github.io/2026/08/31/sppo-sequence-level-ppo/
作者
丁一帆
发布于
2026年8月31日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。