2026 年大模型 PPO:前沿进展、主流范式与论文地图
更新日期:2026-09-07 关键词:PPO、RLHF、RLVR、GRPO、Critic、Trust Region、LLM Agent、Long-Horizon、Turn/Step-Level Credit Assignment
写在前面
如果只看算法名称,2026 年的大模型强化学习似乎已经从 PPO 转向了
GRPO、DAPO、GSPO 和各种
-PO。但从目标函数看,事情并没有这么简单:大量所谓新算法仍保留
PPO 的核心骨架——使用旧策略采样、计算 advantage、用 importance ratio
修正策略变化,再通过 clipping、mask、KL 或其他 divergence
控制更新幅度。
真正发生的变化,是研究者开始把 PPO 拆成几个可以独立替换的部件:
- 反馈从哪里来:人类偏好奖励模型、规则验证器、环境奖励还是过程反馈;
- baseline 如何估计:独立 critic、组内均值、历史统计、轻量 probe,还是共享 actor 的内部状态;
- 信用分配到哪一层:token、segment、完整 sequence、Agent turn,还是可恢复环境中的 branch;
- 策略更新如何受约束:固定 ratio clipping、直接 divergence、位置相关预算、累计 prefix 约束或黎曼几何;
- rollout 如何生产和消费:全量训练、筛选、提前终止、前缀反传、单 rollout、异步采样或大 batch。
本文的核心判断是:PPO 没有消失,而是从一个固定的 actor–critic 算法,演化成了大模型在线策略优化的一套模块化设计空间。2026 年最重要的前沿,不是再给 PPO 换一个缩写,而是让 trust region、advantage 和 credit assignment 真正适配长文本、长尾词表与多轮环境。
本文只收录大模型后训练中的 PPO 及其直接近邻;通信、机器人、调度等“仅把 PPO 当作现成优化器”的应用论文不在范围内。论文检索截至 2026 年 9 月 7 日,并重点补充 long-horizon Agent、turn/step-level PPO、信用分配与多奖励优化。多数工作仍是 arXiv 预印本,实验结果应视为作者报告,而非已经形成的社区共识。
1. 先把 PPO 的坐标系说清楚
给定 prompt \(x\),旧策略或行为策略 \(\pi_{\mathrm{old}}\) 生成回答
\[ y=(y_1,\ldots,y_T), \]
奖励函数给出回报 \(R(x,y)\)。PPO 对第 \(t\) 个 token 使用概率比
\[ r_t(\theta) = \frac{\pi_\theta(y_t\mid x,y_{<t})} {\pi_{\mathrm{old}}(y_t\mid x,y_{<t})}, \]
并优化 clipped surrogate:
\[ L_{\mathrm{PPO}} = \mathbb E_t\left[ \min\left( r_t\hat A_t, \operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t \right) \right]. \]
这里有两个经常被混淆的“不要走太远”:
- PPO clipping / trust region 比较当前训练策略与产生 rollout 的行为策略,主要解决同一批数据被重复更新、异步 rollout 和训练—推理引擎不一致造成的 off-policy 问题;
- reference KL 比较当前策略与冻结的 SFT/reference model,主要防止能力漂移、语言退化和 reward over-optimization。
二者可以同时存在,也不能互相替代。2026 年很多工作正是在重新设计第一种约束。
1.1 PPO 与 GRPO 到底是什么关系
在稀疏终局奖励的 RLVR 中,标准 PPO 通常用 value model 估计
\[ \hat A_t^{\mathrm{PPO}}=R-V_\phi(s_t), \]
而 GRPO 对同一 prompt 采样 \(G\) 条回答,用组内统计量构造
\[ \hat A_i^{\mathrm{GRPO}} = \frac{R_i-\operatorname{mean}(R_{1:G})} {\operatorname{std}(R_{1:G})}. \]
随后,GRPO 仍把这个 sequence-level advantage 广播到 token,并常常继续使用 PPO 式 ratio clipping。也就是说:
GRPO 主要替换了 PPO 的 critic 和 advantage estimator,而没有自动解决 PPO clipping、off-policy correction 与长程信用分配的问题。
因此,把 GRPO、DAPO、GSPO 等完全放到“PPO 的对立面”会错过 2026 年论文之间最重要的继承关系。
2. 2026 年的主流范式
2.1 经典 critic-based PPO:仍是需要状态价值时的强基线
经典 PPO 使用独立 value model 和 GAE,对每个 token 或状态给出不同 advantage。它的优势是能够做状态相关的时间信用分配,尤其适合:
- 多轮 Agent 与环境交互;
- 中间动作会改变后续可达状态的任务;
- 奖励延迟、轨迹很长、同一 prompt 的不同中间状态价值差异很大;
- 不能靠大量同 prompt rollout 稳定估计组内均值的场景。
代价也很直接:一个接近 policy 规模的 critic 会增加显存、前向与反向成本;在 RLVR 的稀疏二元奖励下,中间状态 value 很难学,错误 critic 反而会放大 advantage 方差。
2026 年的关键变化不是简单恢复大 critic,而是让 critic 更容易学、更便宜、更可校准,并且只在它确实有用时使用:
- SAE 只在低概率 token 标出的语义边界进行 bootstrap,减少 GAE 在每个 token 累积 value bias;
- DFPO 用 distributional value flow 表达更丰富的价值分布,面向 noisy reward 与 OOD 泛化;
- EVPO 用 explained variance 判断当前 critic 是降方差还是增方差,并在 PPO baseline 与 batch-mean baseline 间切换;
- POISE 从 actor 的 hidden states 与 entropy 统计中训练轻量 value probe,避免复制一个 policy-scale critic;
- SR-PPO 用 Monte Carlo Pass@\(k\) critic 做单 rollout、token-level credit assignment;
- ReDiPPO 训练时用参考答案校准 critic,并用 reference critic 与普通 critic 的差异识别困难 token;
- HL-Gauss PPO 把 scalar MSE critic 改成离散 value support 上的分类器,再解码期望值供标准 GAE 使用。
这条路线的共识正在变成:critic 不是一定要删掉,而是不能再被当作一个默认正确的黑盒回归器。
2.2 Critic-free PPO/GRPO:单轮可验证推理的默认工程范式
数学、代码与规则可验证任务通常只有终局 reward,但同一题可以并行采样多条答案。在这个设定下,GRPO/RLOO 类方法用组内或 leave-one-out baseline 代替 critic,具有明显的工程优势:
- 不需要加载和训练第二个大模型;
- 训练栈简单,容易扩展到大 policy;
- 对单轮、二元可验证奖励往往有竞争力;
- 多条 rollout 同时提供探索与 baseline 估计。
它的主要风险是:全对或全错的 group 会产生零方差甚至零 advantage;困难 prompt 的组均值噪声很大;同一个 sequence-level advantage 被广播到所有 token;每题多采样又把成本转移到了 rollout。
2026 年的改进包括:
- BV-Blend 把 prompt-local 统计与语义簇的历史 reward moments 按不确定性混合,缓解全对/全错组的 advantage collapse;
- PS-PPO 对每条回答随机采样 cutoff,只对 prefix 反传,并用 \(1/\xi_t\) 重要性权重保持梯度期望无偏;
- SPPO 保留一个只预测题目可解性的轻量 sequence-level critic,以单样本替代 GRPO 的同题多采样;
- I-PPO 在 PPO 更新前用梯度归因过滤与验证方向反对齐的 rollout。
2.3 混合与自适应范式:PPO 和 GRPO 不再是二选一
EVPO 给出了一个很有代表性的统一视角。对 terminal reward \(G\),PPO 与 GRPO 都可以写成
\[ \hat A_t=G-b(s_t), \]
区别只在 baseline:PPO 使用 \(V_\phi(s_t)\),GRPO 使用 batch mean。EVPO 计算
\[ \widehat{\mathrm{EV}} = 1- \frac{\operatorname{Var}(G-V_\phi(s))} {\operatorname{Var}(G)}. \]
当 \(\widehat{\mathrm{EV}}>0\) 时,critic 比常数 baseline 解释了更多回报方差;当 \(\widehat{\mathrm{EV}}\le 0\) 时,critic 的误差比它捕获的状态信号更大。于是可以按训练 step 切换:
\[ b(s_t)= \begin{cases} V_\phi(s_t),&\widehat{\mathrm{EV}}>0,\\ \bar G,&\widehat{\mathrm{EV}}\le 0. \end{cases} \]
作者在 Sokoban、FrozenLake、WebShop 和 MATH 上报告 EVPO 均超过固定 PPO 与 GRPO;例如验证成功率分别为 0.604、0.684、0.303 和 0.416,而 PPO 为 0.314、0.611、0.252 和 0.373。这个结果最值得记住的不是具体分数,而是设计原则:baseline 应随 critic 的成熟度、任务与训练阶段自适应。
SMOPD:多奖励不只需要归一化,还需要先专门化再合并
SMOPD 补充了另一种“混合”含义:不是在 PPO 与 GRPO 之间切换,而是在多个不同密度、甚至彼此冲突的 reward 之间保留能力。更完整的公式推演、实验与局限分析见独立文章《SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并”》。
标准 GRPO 先把各 reward 相加,再对总分做组内标准化,容易发生 reward masking。GDPO 已经改为逐维标准化后加权:
\[ \hat A_i^{(k)}= \frac{r_i^{(k)}-\mu^{(k)}}{\sigma^{(k)}+\epsilon}, \qquad \hat A_i^{\text{GDPO}} \propto \sum_{k=1}^{K}w_k\hat A_i^{(k)}. \]
但逐维归一化只能解决“尺度不同”,无法凭空制造“组内差异”。论文给出的例子是:8 个 prompt group、每组 4 条 rollout;dense reward 在每组都是 \([0,1,2,3]\),而 binary sparse reward 在 7 组中都是 \([0,0,0,0]\),只有 1 组出现 \([1,0,0,0]\)。后者在七八的 group 中方差为零,即使权重平衡也几乎不给梯度。
SMOPD 因而采用两阶段训练:
- Specialize:从同一 base policy 训练多个 reward-specialized teacher。以 accuracy/format 为例,分别使用 \([0.9,0.1]\) 与 \([0.1,0.9]\) 的 reward priority;由于逐维 advantage 已同尺度,目标 reward 获得约 9 倍的相对梯度权重。
- Merge:student 在自己的 on-policy rollout 上生成 prefix;冻结的教师为每个 token 给出 top-\(\kappa\) 分布,均匀混合为 \(p_T^{\text{mix}}\),student 用 mode-covering 的 forward KL 学习所有教师的高概率模式。
仅做蒸馏时,student 最多逼近 teacher mixture。SMOPD 因此保留一个等权 GDPO 序列级 anchor:
\[ \mathcal L_{\text{total}} = \mathcal L_{\text{GDPO-anchor}} +\lambda\sum_t \operatorname{KL} \left(p_T^{\text{mix}}(\cdot\mid s_t)\,\|\,p_\theta(\cdot\mid s_t)\right). \]
这里形成了很有代表性的双粒度组合:anchor 回答“整条 response 应上调还是下调”,token-level OPD 回答“XML 边界、工具名和参数位置分别该像哪个教师”。
作者在 Qwen2.5-1.5B 的工具调用实验中报告:相对 GDPO,format pass 从 8.8% 升到 97.5%,RLLA composite 从 1.849 升到 2.740,API-Bank 的 LLM-judge accuracy 从 83.6% 升到 87.1%。在 helpful/harmless 冲突奖励上,Qwen2.5-7B 的 overall 从 GDPO 的 5.498 升到 5.646,并高于两个单独教师;但 Llama-3.2-3B 的 5.590 仍略低于 GD\(^2\)PO 的 5.605,因此证据支持“稳定优于 GDPO”,还不能概括成对所有多奖励 baseline 都占优。
消融进一步说明:去掉 anchor 的 OPD-only 为 5.544,加入 anchor 后为 5.639;top-16 已保留约 99.4% 的 teacher probability mass,\(\kappa=16\) 到 64 的 overall 只差 0.007;sampled-token reverse KL 比 top-16 forward KL 低 0.082。附录中的 sequence/token adaptive gate 也没有稳定超过无参数的均匀 teacher mixing。
这篇论文与 long-horizon credit assignment 是正交关系:它解决的是 reward dimension 之间的 credit 与能力冲突,不是同一条长轨迹中不同 turn 的时间信用。它可以成为 Turn-PPO、GiGPO 或其他 Agent RL 的多奖励上层,但论文目前没有在长程、多轮环境中验证这种组合。
2.4 Sequence/segment/turn/branch:信用分配粒度正在上移
把每个 token 都当作同等重要的 MDP action,在长 CoT 上既昂贵又容易产生虚假的精细度。2026 年形成了四种不同粒度:
| 粒度 | 代表方法 | 解决什么问题 | 主要风险 |
|---|---|---|---|
| Token | 经典 PPO、ReDiPPO、HL-Gauss PPO | 最细的状态相关 credit | critic 难学,长序列误差累积 |
| Segment | SAE、SP3O | 在语义段落或偏好片段上分配信用 | 分段边界可能不等于因果边界 |
| Sequence | SPPO、SSPO、GRPO/GSPO | 与终局 reward 对齐,训练简单 | 成功轨迹中的坏步骤也被奖励 |
| Turn / Step | Turn-PPO、GiGPO、TRACE、SAPO | 面向多轮环境和工具调用分配局部信用 | 需要可比较状态、可靠 value 或过程信号 |
| Branch | BPO | 在可恢复 sandbox 中构造局部反事实 | 依赖 snapshot/restore 与额外 continuation |
SAE 使用生成概率低于阈值 \(p\) 的 token 作为 segment boundary;段内不衰减 TD error,只在跨段时乘 \(\lambda\)。在 Qwen3-8B、DAPO-Math-17k 上,作者报告四个数学测试集平均分 40.98,高于最强对照 38.89;GRPO 在约 400 step 后不稳定,而 PPO 系方法保持收敛。
SPPO 则把整条推理视为 contextual bandit 的一个 action,只训练 \(V(s_p)\) 预测题目可解性,并把 \(R-V(s_p)\) 广播给序列中的 token。它在 1.5B 模型上用每题一个 rollout 得到 48.06 平均分,作者报告略高于每题 8 个 rollout 的 GRPO 47.08;7B policy 配 1.5B critic 的版本达到 58.56。
两者代表两种不同判断:SAE 认为长序列仍然存在可利用的中间状态,只是不应每个 token 都 bootstrap;SPPO 认为在只有 outcome reward 的数学任务中,强行拟合 token value 可能不如直接退化成 sequence-level bandit。它们不是谁普遍胜过谁,而是对“任务究竟是不是一个可识别的多步 MDP”给出了不同答案。
2.5 Agentic PPO:从初始 prompt baseline 走向状态条件 baseline
对 WebShop、ALFWorld、SWE-bench 这类任务,环境会在每轮动作后改变。此时只按初始 prompt 比较多条完整轨迹,会把早期偶然性、环境反馈和后期动作全部揉成一个 terminal reward。
Branching Policy Optimization 利用 sandbox 可 snapshot/restore 的性质,在高 entropy 中间状态分叉。若同一状态 \(s_t\) 下有 \(K\) 个 sibling rollout,它用 leave-one-out return 构造
\[ \hat A(s_t,a_t^{(k)}) = G_t^{(k)}- \frac{1}{K-1}\sum_{j\ne k}G_t^{(j)}. \]
这比从初始状态独立采样的 GRPO 更接近“控制变量”实验:共享 prefix,只改变后续动作。作者在匹配 rollout 预算下报告 WebShop、ALFWorld、SWE-bench Verified 成功率 67.8%、66.4%、29.8%,对应最佳 baseline 为 63.5%、61.2%、25.1%,并把梯度范数方差降到 GRPO 的约 0.42–0.58。
SAPO 走另一条路线:在同一个 autoregressive backbone 的不同 causal boundary 上同时输出 policy、state value 与 action value,用一条 rollout 做 turn-level GAE,而不加载独立 critic,也不进行 group sampling。作者在 Qwen2.5-7B 上报告 ALFWorld 聚合成功率 94.0%、WebShop 成功率 82.4%,并相对独立 critic PPO 将单次迭代从 451.2 秒降到 301.4 秒。
这里的前沿方向很明确:Agent RL 的有效 baseline 应尽量条件化到真正的环境状态,而不是只条件化到初始 prompt。
3. Long-Horizon 专题:Turn/Step-Level PPO 的研究地图
3.1 先统一术语:长上下文不等于长程决策
这组论文最容易产生的误解,是把 long-context、long-CoT、long-horizon 和 long-term memory 混成一件事。它们对应的瓶颈并不相同:
| 概念 | 核心含义 | 环境是否在中途反馈 | PPO 的主要难点 |
|---|---|---|---|
| Long-context | 模型一次可读取很多 token | 不一定 | 显存、attention 与 position generalization |
| Long-CoT | 单次回答包含很长推理链 | 通常否 | token/segment credit 与长序列 importance ratio |
| Long-horizon | 完成任务需要很多次动作—观察循环 | 是 | 探索、延迟奖励、状态价值与跨步信用分配 |
| Long-term memory | 信息跨任务或跨 session 持久化 | 是 | memory update 对未来任务的延迟影响 |
本文约定:一个 turn 是 LLM 在一次环境反馈前生成的完整响应,一个 environment step 是环境执行一次动作并返回新观察。当每个 turn 只产生一个工具调用时,两者等价;若一个响应包含多个动作,或环境内部执行多个低层控制步,turn 与 step 就不再相同。token 则是 turn 内部的自回归微动作。
因此,一条 Agent 轨迹可写成
\[ \tau=(s_0,u_0,r_0,s_1,u_1,r_1,\ldots,s_H), \]
其中 \(s_k\) 是包含任务、历史观察、memory 与工具状态的 turn-boundary state,\(u_k=(y_{k,1},\ldots,y_{k,L_k})\) 是第 \(k\) 个 turn 的文本动作。Turn-level PPO 并不是停止训练 token,而是在 turn 边界估计 credit,再把同一个 turn 的 advantage 分配给该 turn 内可学习的 token。
3.2 为什么 trajectory-level PPO/GRPO 会随 horizon 失效
最常见的多轮 GRPO 实现只在任务结束时得到 \(R(\tau_i)\),再对同一任务的多条轨迹做组内标准化:
\[ A_i^{\text{traj}} = \frac{R(\tau_i)-\operatorname{mean}_{j}R(\tau_j)} {\operatorname{std}_{j}R(\tau_j)+\epsilon}, \qquad A_{i,k}=A_i^{\text{traj}}\;\;\forall k. \]
这会把一条成功轨迹中的冗余、无效甚至错误动作一并奖励,也会把失败轨迹中已经完成的子目标全部惩罚。horizon 增大后,问题会同时从五个方向恶化:
- 探索概率快速下降:若每一步独立正确的概率近似为 \(p\),完整成功率按教学近似会缩到 \(p^H\);全零 reward group 随之增多。
- 时间混叠:早期好动作可能被最后一步失败覆盖,晚期补救动作也可能被早期幸运状态“搭便车”。
- baseline 错位:只条件化初始 prompt 的组均值,不知道 agent 在第 \(k\) 步实际到达了哪个环境状态。
- 有效样本浪费:失败轨迹中的局部进展无法被学习;长轨迹越贵,这种浪费越严重。
- 系统偏移累积:长 rollout 加剧 policy staleness、上下文截断、工具错误和 trainer–inference mismatch。
On Training Large Language Models for Long-Horizon Tasks 用“只改变所需步数、尽量保持规则和推理结构不变”的受控任务验证:horizon 本身就是训练瓶颈。作者还发现,使用高层动作或子目标缩短有效 horizon,不仅稳定训练,而且能产生从短 horizon 到长 horizon 的泛化。这意味着信用分配并不是唯一解;重新设计 action abstraction 可能比发明更复杂的 estimator 更有效。
3.3 五类主流范式
3.3.1 Critic-based turn MDP:把 GAE 放到环境边界
这是最直接、也最接近经典 PPO 的路线。critic 不再给每个 token prefix 拟合一个 value,而是在环境真正改变的 turn boundary 上估计 \(V(s_k)\):
\[ \delta_k=r_k+\gamma V(s_{k+1})-V(s_k), \qquad \hat A_k=\sum_{l=0}^{H-k-1}(\gamma\lambda)^l\delta_{k+l}. \]
随后用 \(\hat A_k\) 更新 turn \(u_k\) 内的 policy token。其优势是 baseline 与真实状态对齐,计算图也不必在环境 observation token 上反传。
- Fine-Grained Reward Structure and Credit Assignment 的 2026 年 8 月修订版系统区分 terminal、delayed 与 per-turn reward,并分别推导 multi-turn PPO/GRPO。作者报告 dense per-turn PPO 在搜索任务上更稳定、收敛更快。
- Turn-PPO 直接把一整个 turn 视作 MDP action,在 WebShop 和 Sokoban 上发现 PPO 比直接移植的 GRPO 更稳;该工作已发表于 EACL 2026。
- Odysseus 把轻量 turn-level critic 扩展到视觉游戏中的 100+ turn 决策,并报告其稳定性和样本效率优于 GRPO 与 Reinforce++。
- SAPO 进一步把 policy、\(V\) 与 \(Q\) 放进同一自回归 backbone,在保持状态条件 baseline 的同时避免独立 critic 与 group rollout 的成本。
这条路线最适合“环境状态真的变化、单条 trajectory 很贵、未来回报可由当前状态预测”的任务。它的软肋仍是 critic calibration:部分可观测、历史过长或 reward 极稀疏时,\(V(s_k)\) 可能只是在拟合轨迹长度和表面模式。
3.3.2 Critic-free 局部比较:只比较可比的状态与动作
另一条路线保留 GRPO 的 critic-free 优点,但把比较单位从整条 trajectory 下沉到局部状态。
GiGPO 的核心是两层 advantage:trajectory group 给出 macro credit,重复到达同一 anchor state 的动作组给出 micro credit。概念上可写成
\[ A_{i,k}=A_i^{\text{episode}}+\alpha A_{i,k}^{\text{anchor}}. \]
它在 ALFWorld 与 WebShop 上相对 GRPO 分别报告超过 12% 和 9% 的提升,并且不增加 rollout。但“相同状态”样本少时,局部均值会被幸运动作支配。ECPO 因此按 canonical action 聚合,并对低计数估计做 shrinkage,再用方差门控压低噪声 anchor 的权重;作者报告在 1.5B 模型上相对 GiGPO 提升 ALFWorld 5.2、WebShop 7.3 个成功率百分点。
同一族还有三种任务特化形式:
- TL-GRPO 面向“每轮在同一底层对象上迭代、最终看 best-turn reward”的优化任务,在模拟预算固定时进行 turn-level group sampling;
- MatchTIR 将预测工具轨迹与 ground-truth trace 做二分图匹配,再融合 turn 与 trajectory 两级 advantage;
- MemoPilot 用 context-independent turn advantage 训练 memory updater,而冻结实际执行任务的 LLM,说明 turn-level RL 也可以优化跨轮记忆而非直接优化动作策略。
这类方法的关键不是“没有 critic”,而是是否真的找到了条件足够接近的 comparison set。若状态哈希、动作 canonicalization 或重复访问率不可靠,micro advantage 只是把 trajectory 噪声换成了小样本噪声。
3.3.3 Reward shaping 与 potential:把结果分数转换成进展
很多环境能在每轮产生一个 score,但 dense score 不等于 dense credit。score \(q_k\) 表示当前状态有多好,credit 应表示动作让状态变好了多少。最经典的安全形式是 potential-based shaping:
\[ \tilde r_k=r_k+\gamma\Phi(s_{k+1})-\Phi(s_k). \]
2026 年最密集的新工作几乎都在设计不同来源的 \(\Phi\) 或 score-to-credit 转换:
- BEACON 用任务 milestone 切分轨迹,在 segment 内做 temporal shaping,并融合局部与全局 advantage。作者在 long-horizon ALFWorld 上报告 92.9% 成功率,对比 GRPO 的 53.5%;有效样本利用率从 23.7% 提升到 82.0%。
- TRACE 在工具调用边界计算冻结参考模型对 gold answer 的 log-probability,以 log-ratio 状态值的 TD 差作为 action reward,不训练额外 critic。作者在 BrowseComp-Plus 上把 Qwen3-4B 从 7.2 提升到 35.6、Qwen3-30B-A3B 从 8.4 提升到 42.6。
- SIOP 在没有 verifier 或 gold answer 时,把多条 rollout 的最终答案聚成语义 outcome modes,以模型自己对可靠 outcome cluster 的后验提升构造 turn potential。
- TCPO 针对 iterative refinement,结合相对历史最佳状态的即时进退、延迟 hindsight credit,以及只在高 surprisal turn 上执行的 fixed-history counterfactual。
- CAST 直接使用游戏 solver 的 state-value change 作为 turn advantage;在 soft-optimal 假设下,这等价于只传标量 value 的 on-policy solver distillation。
- ABSeeker 从 gold answer 反向恢复中间 clues,再据此给搜索 step 打分,并分别形成 ABC-SFT 与 ABC-GRPO。
这条范式最强,但也最容易产生隐藏的数据泄漏:gold answer、ground-truth trace、solver 或强 verifier 若在训练时可用而部署时不可用,方法提升可能来自 privileged supervision,而不只是更好的 PPO。
3.3.4 Hindsight、动态模型与自蒸馏:事后识别关键一步
有些动作只有看到后续结果才知道价值,局部即时 reward 无法判断。于是研究开始使用完整 future 做后验 credit:
- HCAPO 让 LLM 在轨迹结束后充当 critic,hindsight 修正 step-level \(Q\),再用 multi-scale advantage 补足中间状态 baseline;作者在 Qwen2.5-7B 上相对 GRPO 报告 WebShop +7.7、ALFWorld +13.8 个百分点。
- SHADOW 先按 transition dynamics 约束可比较状态,再用局部动态与 GAE 分配 action credit,避免把表面相似但后继分布不同的状态混为一组。
- AgentOPSD 把 privileged teacher 与 student 的 token log-probability gap 聚合成 turn evidence,再在 log-odds 空间递归更新 belief;它不需要额外 critic 或 rollout,并在 Qwen2.5-7B/ALFWorld 上报告 89.1% 成功率。
Hindsight 的优点是能识别“当时看似普通、后来证明关键”的动作;风险是 post-hoc rationalization。一个会讲故事的 LLM critic 不一定在估计因果贡献,因此必须加入状态分叉、动作替换或人工标注的小规模因果校准集。
3.3.5 Branch counterfactual 与层级解耦:改变训练数据的基本单位
如果环境支持 snapshot/restore,最干净的局部 baseline 不是猜 value,而是在同一状态执行多个 candidate action。BPO 就是在高 entropy 中间状态分叉,用 sibling continuation 构造 leave-one-out advantage。代价是额外环境执行,但比较的因果含义明显强于从初始 prompt 独立采样。
Agent Lightning 则从系统接口解决问题:把复杂 Agent 的执行日志分解为独立 transition,由 credit module 给每次 LLM call 分配 reward,再交给 PPO、GRPO 等任意单步优化器。这提示了一个更长期的主流形态:Agent runtime 负责状态、观测与因果边界,policy optimizer 只消费标准化的 step transition。
3.4 最新论文时间线:2025 奠基,2026 转向精细信用
下表只列与 long-horizon、turn/step-level policy optimization
直接相关的工作。PPO 关系表示它是否直接使用 actor–critic
PPO,或使用保留 PPO clipped surrogate 的 GRPO 近邻。
| 时间 | 论文 | PPO 关系 | Credit 粒度与新增能力 | 主要实验场景 |
|---|---|---|---|---|
| 2025-05 | GiGPO | GRPO/PPO 近邻 | episode + anchor-state step advantage | ALFWorld、WebShop、Search-QA |
| 2025-05 / 2026-08 v3 | Fine-Grained Reward Structure and Credit Assignment | MT-PPO + MT-GRPO | terminal/delayed/per-turn reward 统一推导 | 多轮搜索、游戏 |
| 2025-08 | Agent Lightning | 可接 PPO/GRPO | 将任意 Agent 轨迹分解成训练 transition | Text-to-SQL、RAG、工具数学 |
| 2025-08 | Long-Context Multi-Turn SWE Agents | modified DAPO | 多轮有状态环境中的长上下文 RL | SWE-bench Verified、SWE-rebench |
| 2025-10 | Practitioner’s Guide to Multi-turn Agentic RL | 比较 PPO/GRPO/RLOO | 环境、reward sparsity、policy 联合消融 | TextWorld、ALFWorld、SWE-Gym |
| 2025-12 / EACL 2026 | Turn-PPO | 直接 PPO | turn-level MDP 与 advantage estimation | WebShop、Sokoban |
| 2026-01 | MatchTIR | clipped policy optimization | trace matching + turn/trajectory dual advantage | 工具集成推理 |
| 2026-01 | TL-GRPO | GRPO/PPO 近邻 | 对同一优化对象做 turn group sampling | 模拟电路 sizing |
| 2026-03 | HCAPO | GRPO/PPO 近邻 | hindsight step-\(Q\) + multi-scale advantage | ALFWorld、WebShop 等 |
| 2026-03 | SHADOW | GAE/PPO 系 | dynamics-aware state group + local GAE | ALFWorld、WebShop |
| 2026-05 | Odysseus | 直接 PPO | lightweight turn critic 扩展到 100+ turns | Super Mario Land、跨游戏泛化 |
| 2026-05 | Horizon Length Study | 方法诊断 | 控制变量证明 horizon 本身造成不稳定 | Sudoku、Rush Hour、网页导航 |
| 2026-05 | SIOP | 可接 group policy optimization | 无 verifier 的 outcome-cluster potential | 7 个搜索增强推理基准 |
| 2026-05 | BEACON | GRPO/PPO 近邻 | milestone segment + dual-scale advantage | ALFWorld、WebShop、ScienceWorld |
| 2026-06 | ECPO | critic-free clipped PO | 小样本 shrinkage + variance-gated step credit | ALFWorld、WebShop |
| 2026-06 | MemoPilot | multi-turn GRPO | turn-wise reward 优化跨轮 memory update | 扑克、石头剪刀布 |
| 2026-07 | TRACE | 可接标准 policy update | answer log-ratio potential 的 turn TD reward | BrowseComp-Plus、开放网页搜索 |
| 2026-07 | CAST | RLVR/PPO 近邻 | solver value difference 作 turn teacher | Sokoban、Minesweeper、Rush Hour |
| 2026-08 | TCPO | turn-level clipped PO | score-to-credit + selective counterfactual | 数学、代码、AppWorld |
| 2026-08 | ABSeeker | ABC-GRPO | answer-backtracked clue reward | BrowseComp、BrowseComp-ZH |
| 2026-08 | AgentOPSD | 可接标准 policy optimization | recursive self-distillation turn credit | ALFWorld、WebShop、Search-QA |
这张时间线显示出一个反转:2024–2025 年的主线是“删掉 critic,扩大 group sampling”;到了 2026 年,长程任务又把研究推回 状态条件 baseline、TD difference、multi-scale advantage 与反事实 continuation。critic-free 没有消失,但它必须用 anchor、milestone、solver、reference model 或 self-distillation 补回状态信息。
3.5 如何选择 Turn/Step-Level PPO
| 你实际拥有的信号与环境能力 | 优先起点 | 原因 |
|---|---|---|
| 每轮有可信 reward,状态可输入 critic | MT-PPO / Turn-PPO | turn GAE 直接、样本利用率高 |
| 单条 rollout 很贵,但状态 value 可预测 | Turn-PPO / SAPO / lightweight critic | 避免每题大量 group rollout |
| 多条轨迹会重复访问同一状态 | GiGPO;小样本时加 ECPO 式校准 | 能构造局部同状态动作对照 |
| 任务有明确子目标或进度节点 | BEACON | milestone 可隔离远端失败对局部 credit 的污染 |
| 有 gold answer,但没有过程标签 | TRACE;搜索任务可用 ABSeeker | 从答案构造 potential 或反向 clues |
| 每轮有 verifier score,目标是迭代改进 | TCPO | 显式把 state score 转换为 turn credit |
| 没有 gold answer 和稳定 verifier | SIOP | 从 rollout outcome cluster 提取自监督 potential |
| 有规则 solver 或可计算 state value | CAST | 标量 teacher value 比 LLM judge 更可校准 |
| 环境可 snapshot/restore | BPO | 同状态 continuation 提供更接近因果的 baseline |
| 任务超过 100 turns 或包含视觉控制 | Odysseus 式 turn critic + action abstraction | critic-free group 方法的 rollout 成本和方差更难控制 |
一个稳妥的默认 recipe 是:先把交互形式化成 turn-level MDP,以 outcome-only PPO/GRPO 为基线;再依次加入 turn-boundary critic、局部 progress reward 与 dual-scale advantage。只有在环境可恢复时,才把昂贵的 branch counterfactual 用于高不确定关键状态。
3.6 Long-Horizon 实验应该怎样做
仅报告最终成功率不足以证明 credit assignment 有效。一个可信实验至少应包含:
- 控制 horizon:保持任务规则近似不变,只改变最短成功步数 \(H\),画出 success–horizon 与 variance–horizon 曲线。
- 跨 horizon 泛化:在短、中、长三个区间训练并交叉测试,区分“记住训练长度”与真正的 horizon generalization。
- 信用质量:在可恢复环境中抽样关键状态,用多个 continuation 近似 action value,测 estimated advantage 的 rank correlation、sign accuracy 与 calibration。
- 局部行为指标:报告 invalid-action rate、重复工具调用、子目标完成率、首次错误位置和 turns-to-success,而不只看 terminal reward。
- 系统成本:统一统计 environment steps、rollout tokens、额外 verifier/solver/critic FLOPs、峰值显存和 wall-clock time-to-target。
- 多 seed 与训练曲线:长程 RL 的主要问题恰是高方差;单 seed 的最佳 checkpoint 没有说服力。
最关键的 ablation 包括:
- outcome-only、dense score、score difference 与完整 credit estimator 四级对照;
- token、turn、segment、trajectory 四种 credit 粒度对照;
- 去掉 global advantage 或 local advantage,检验 dual-scale 是否真的必要;
- 改变 group size、anchor 最小计数与 critic 容量,观察收益是否只是更多计算带来的;
- 移除 gold answer、solver、ground-truth trace 等 privileged signal,明确部署时的真实可用条件;
- 保持总 environment-step 预算一致,避免 branch 或更多 rollout 获得不公平优势。
3.7 当前最可靠的结论
- 长程任务应首先建模为 turn-level MDP。 token 仍是优化单元,但不应默认是唯一的信用边界。
- critic 在 long-horizon 中重新变得有价值。 当环境状态改变且 rollout 昂贵时,状态条件 value 往往比初始 prompt 下的 group mean 更合适。
- 更密的分数不自动等于更好的 credit。 真正关键的是 \(q(s_k)\) 到 \(q(s_{k+1})-q(s_k)\)、hindsight contribution 或 counterfactual advantage 的转换。
- 局部与全局信号需要同时存在。 纯局部 reward 容易奖励“格式正确但目标无效”的动作,纯 terminal reward 又无法定位关键决策。
- 缩短有效 horizon 是被低估的基线。 高层动作、子目标和 milestone 有时比复杂 advantage estimator 更稳定,也更容易泛化。
4. 2026 年最重要的前沿进展
4.1 从固定 ratio clipping 转向真实的 distributional trust region
PPO 用采样 token 的 ratio 近似策略分布变化。这在动作空间很小的经典控制中可能够用,但 LLM 的词表巨大且长尾。考虑一个教学用简化例子,clipping 区间为 \([0.8,1.2]\):
| token | 旧概率 | 新概率 | ratio | 绝对概率变化 | PPO 判断 |
|---|---|---|---|---|---|
| 稀有 token | \(10^{-4}\) | \(10^{-2}\) | 100 | 0.0099 | 强制 clipping |
| 高频 token | 0.99 | 0.80 | 0.808 | 0.19 | 可能仍放行 |
第一个更新的 ratio 很大,但只移动了不到 1% 概率质量;第二个 ratio 接近 clipping 下界,却移动了 19% 概率质量。固定 ratio 因而会过度惩罚可能带来新推理路径的低概率 token,同时低估高概率 token 的破坏性变化。
DPPO 用 TV/KL divergence 是否超过阈值来决定 mask,并提供 binary 与 Top-\(K\) 近似以避免保存完整词表分布。作者还发现,训练崩溃往往由不超过 0.5% 的“坏更新”触发:它们对负样本中的高概率 token 施加过大的反向移动。DPPO 在 RLHF 设置中也报告了更快 reward 提升,并在 Qwen3/AlpacaEval 2.0 上得到 80.90 的 length-controlled win rate。
这一主线随后迅速分化:
- BandPO 把 \(f\)-divergence trust region 投影为与旧概率相关的动态 clipping band;
- DRPO 用平滑、advantage-weighted quadratic regularizer 替代越界后直接丢弃梯度的 hard mask;
- CPPO 认为 early token 的偏移会影响更长 suffix,因此给早期位置更紧的预算,并累积约束 prefix divergence;
- Predictive Divergence Masks 不再用 \(\hat A(r-1)\) 判断更新朝向,而是直接预测一次 policy-gradient step 会让 divergence 增大还是减小;
- RIPO 从策略分布的黎曼几何出发,令 clipping boundary 随旧概率变化,以减少长尾探索 collapse;
- ERPO 把部分 regularization 从 response policy 移到训练 query distribution,用 Query-KL 控制输入侧漂移,以保留 action-side exploration。
我的判断是,固定 \([1-\epsilon,1+\epsilon]\) ratio clipping 正在从“默认正确的 PPO 核心”退化为一个可用但粗糙的工程近似。下一代主流实现很可能仍保留 PPO 式一阶更新,却改用 probability-aware、divergence-aware 和 position-aware 的约束。
4.2 Importance sampling 从单 token 走向 prefix 与多步修正
标准 PPO/GRPO 的 token ratio 只修正当前 action 的概率,没有修正到达当前 prefix 的状态分布:
\[ r_t= \frac{\pi_\theta(y_t\mid y_{<t},x)} {\pi_b(y_t\mid y_{<t},x)}. \]
理论上,位置 \(t\) 的 state-action mismatch 应包含整个 prefix:
\[ \rho_t^{\mathrm{cum}} = \prod_{j=1}^{t} \frac{\pi_\theta(y_j\mid y_{<j},x)} {\pi_b(y_j\mid y_{<j},x)}. \]
但整条 sequence ratio 又会因为大量乘法产生极高方差。2026 年工作的共同目标,是在局部低方差和全轨迹无偏之间找连续中间点:
- CTPO 使用 cumulative-token ratio,并随位置收紧 clipping;作者在 Qwen3-4B/14B 的四个竞赛数学基准上报告平均 51.4/58.8,高于 GRPO 的 43.2/54.6 与 GSPO 的 47.7/55.5;
- NFPO 使用未来 \(N-1\) 个 token 的 likelihood-ratio trace,在 PPO 局部 surrogate 与 exact policy gradient 之间连续插值;
- SSPO 在 sequence-level importance weight 内加入基于 token ratio 的 soft gate;
- R\(^2\)VPO 约束 ratio variance,用“soft brake”保留高回报、高 divergence 的探索样本,并允许复用 stale data;
- Missing Old Logits 指出异步 Agent RL 若丢失历史 trainer logits,会把训练—推理差异与 policy staleness 混为一个 ratio,并系统比较 old-logit 恢复策略。
这条路线的重要性不只在公式。只要 rollout engine 与 trainer 分离、一个 batch 被训练多轮或流水线异步运行,LLM RL 就不是理想化的严格 on-policy 算法;off-policy correction 已经成为系统语义的一部分。
4.3 Rollout 不再是“先全部生成,再全部训练”的固定数据管道
长 CoT 和多轮 Agent 的最大成本常常是 rollout,而不是一次 loss 计算。2026 年论文开始直接优化 rollout 的生产、筛选和反传范围:
- I-PPO 用 rollout gradient 与高质量 validation gradient 的对齐度过滤负 influence episode;
- ESPO 用采样时已有 logits 构造 surrogate regret,检测不可恢复的错误后把轨迹终止为 absorbing failure state;在 7B 数学模型上,作者报告相对 PPO 平均准确率提高 1.97 个百分点,同时少用约 22% rollout token;
- PS-PPO 生成完整回答用于 reward,但只对随机 prefix 反传;作者报告每 step 训练时间下降 33%–45%、峰值显存下降 15%–17%,在最大长度 4096 时 update stage 相对 DAPO 加速 3.3 倍;
- BPO 不再从初始状态重复独立 rollout,而是在高不确定中间状态恢复环境并分叉;
- When Do Larger Batches Help Scale LLM RL? 区分 sample efficiency 与 systems throughput,发现 Adam 配平方根 learning-rate scaling 可在一定范围内保持 batch-size invariance;GRPO 的生成吞吐最高提高 2.29 倍,但 batch 不重新调参时反而更慢。
前沿系统的优化目标因此不应只是“每 step reward 更高”,而应至少同时报告:
\[ \text{time-to-target},\quad \text{tokens-to-target},\quad \text{peak memory},\quad \text{samples-to-target}. \]
5. 一张图理解主流训练栈
大模型 PPO 系方法可以被统一成下面的流水线:
1 | |
这个视角也解释了为什么只比较“PPO、GRPO、DAPO 谁最好”经常没有意义:两篇论文可能同时改了 baseline、采样数量、credit 粒度、clipping、长度归一化和 batch size,最后的差异无法归因到某一个算法名称。
6. 2026 年代表论文索引
下表按首次 arXiv 提交月份整理,重点收录直接改变大模型 PPO/GRPO 训练机制的工作。它是研究地图,不是穷尽列表,也不代表所有论文已经通过同行评审。
| 月份 | 论文 | 主要问题 | 一句话方法 |
|---|---|---|---|
| 01 | Segmental Advantage Estimation | token GAE bias | 用低概率 token 分段,只在段边界衰减 advantage |
| 01 | MatchTIR | 工具调用被统一分配 trajectory credit | trace matching + turn/trajectory dual advantage |
| 01 | TL-GRPO | iterative optimization 的 best-turn 目标 | 在 turn 层做 group sampling 与相对优化 |
| 02 | Rethinking the Trust Region / DPPO | ratio 不等于 divergence | 用 Binary/Top-\(K\) TV/KL 直接决定 trust-region mask |
| 02 | DFPO | noisy reward 下的 value modeling | 用连续 distributional value flow 建模 critic |
| 02 | Soft Sequence Policy Optimization | sequence IS 与 hard clip | sequence weight 内使用 token-level soft gate |
| 03 | BandPO | 稀有 token 被固定 clip 压制 | 将 \(f\)-divergence 投影成 probability-aware clipping band |
| 03 | HCAPO | 长程 Agent 的 step-\(Q\) 不准 | LLM hindsight critic + multi-scale advantage |
| 04 | I-PPO | rollout 噪声与不忠实 CoT | 用 validation-gradient influence 筛选 episode |
| 04 | SPPO | critic 成本与长 CoT | sequence contextual bandit + 轻量题目价值模型 |
| 04 | EVPO | critic 何时有害 | 按 explained variance 在 critic 与 batch mean 间切换 |
| 05 | CTPO | token ratio 忽略 prefix mismatch | cumulative-token ratio + position-adaptive clip |
| 05 | Odysseus | VLM Agent 难扩展到 100+ turns | PPO + lightweight turn-level critic |
| 05 | Horizon Length Study | horizon 本身是否造成不稳定 | 受控改变步数并验证 horizon reduction/generalization |
| 05 | SIOP | 无 verifier 时的 turn credit | outcome cluster 构造自监督 potential |
| 05 | BEACON | 早期正确动作被末端失败误罚 | milestone 分段塑形 + dual-scale advantage |
| 05 | POISE | policy-scale critic 太贵 | 用 actor hidden state 和 entropy 训练轻量 probe |
| 05 | Missing Old Logits | 异步 RL 的 ratio 语义错位 | 分离训练—推理差异与 policy staleness correction |
| 05 | NFPO | PPO surrogate 的局部偏差 | 用 \(N\)-step forward likelihood-ratio trace 连续调节偏差—方差 |
| 05 | R\(^2\)VPO | hard clipping 丢失发现信号 | 用 ratio variance regularization 代替二值截断 |
| 05 | ESPO | 错误后继续 rollout 的浪费 | 在线检测 failure,提前进入 absorbing terminal state |
| 06 | DRPO | divergence hard mask 丢梯度 | 对 policy shift 使用平滑 advantage-weighted regularizer |
| 06 | ECPO | anchor step credit 的小样本偏差 | action-level shrinkage + variance-gated weighting |
| 06 | MemoPilot | memory update 的长程回报 | turn-wise reward + context-independent advantage |
| 06 | CPPO | uniform token trust region | 位置权重 + cumulative prefix-divergence budget |
| 06 | SR-PPO / Monte Carlo Pass@\(k\) Critic | 单 rollout 信用分配 | 预测 prefix 的 Pass@\(k\) 可达成功概率 |
| 06 | BV-Blend | GRPO 全对/全错组失去信号 | 混合当前组统计与语义簇历史 moments |
| 06 | PS-PPO | 长回答反传成本 | 随机 prefix 反传 + 无偏 importance reweighting |
| 07 | RIPO | exploration collapse | 按策略流形几何设计 probability-dependent clip |
| 07 | Predictive Divergence Masks | ratio 方向与 divergence 方向不一致 | 预测梯度 step 对 divergence 的一阶变化 |
| 07 | TRACE | 搜索 Agent 终局 reward 稀疏 | gold-answer log-ratio potential 的 turn TD reward |
| 07 | Branching Policy Optimization | Agent 轨迹 advantage 方差 | snapshot 中间状态,以 sibling rollout 作局部 baseline |
| 07 | CAST | 长程游戏缺少便宜的过程信号 | solver state-value difference 作 turn advantage |
| 07 | ReDiPPO | 数学中间 value 不准 | reference-guided critic + discrepancy-aware token reweighting |
| 08 | Categorical Critics / HL-Gauss PPO | scalar MSE critic 校准差 | 分类式 value support + 平滑 HL-Gauss target |
| 08 | TCPO | dense verifier score 不等于 credit | retrospective + hindsight + selective counterfactual |
| 08 | SP3O | 长轨迹偏好反馈太粗 | 用 segment preference 构造 reward-model-free PPO loss |
| 08 | SMOPD | dense/sparse reward 的信号密度不平衡 | reward-specialized teachers + token OPD + GDPO anchor |
| 08 | ABSeeker | 搜索失败轨迹中的有效步骤被浪费 | answer-backtracked clues 生成 step reward |
| 08 | AgentOPSD | 关键 turn 难从终局奖励识别 | 递归 Bayesian self-distillation turn credit |
| 08 | SAPO | Agent critic 与多 rollout 成本 | 一个 autoregressive backbone 同时表示 policy、\(V\) 与 \(Q\) |
| 08 | ERPO | Policy-KL 压制探索 | 用 Query-KL 在输入侧控制训练分布漂移 |
| 08 | When Do Larger Batches Help Scale LLM RL? | batch 扩展是否真加速 | 联合建模 samples-to-target 与 generation throughput |
另有一篇重要的跨领域理论工作 KLip-PPO:它证明 PPO-Clip 的梯度可等价写成一个 per-sample KL surrogate,系数由该样本的 ratio 与 advantage 决定。论文实验在 MuJoCo 而非 LLM 上,因此不列为 LLM 实证结论,但它支持一个很有用的解释:PPO-Clip 的关键不是“有无 KL”,而是正则强度是否按样本自适应。
7. 如何为不同任务选择范式
| 场景 | 更合理的起点 | 原因 | 优先观察的诊断量 |
|---|---|---|---|
| 单轮数学/代码 RLVR,验证器可靠 | GRPO/RLOO 类 critic-free PPO | 架构简单,多采样兼顾探索 | zero-advantage group、entropy、clip fraction |
| rollout 很贵、prompt 很多 | SPPO、POISE、PS-PPO 或单 rollout critic | 减少同题重复生成或缩短反传 | tokens/time-to-target、critic calibration |
| 长 CoT 但只有 outcome reward | SAE 与 sequence-level 方法对照 | 先判断 segment credit 是否真有用 | value error、advantage 与近似真值相关性 |
| 多轮工具/网页/游戏 Agent | Turn-PPO/SAPO;可分叉时 BPO | 状态价值与局部反事实更重要 | turn-value calibration、梯度方差、恢复成本 |
| 有 milestone、gold answer 或 solver 的长程任务 | BEACON/TRACE/CAST/TCPO | 可把 privileged signal 转为 turn progress | credit calibration、部署时信号可用性 |
| 同一任务同时有 dense 与 sparse reward | GDPO 基线,再比较 SMOPD | 逐维归一化不能修复 sparse reward 的组内零方差 | 每维 non-zero advantage group、Pareto frontier、教师与蒸馏成本 |
| 异步训练或 rollout/trainer 分离 | 明确 old logits 与 behavior policy | correction 的分母语义必须正确 | staleness、engine mismatch、bad-update rate |
| entropy 快速下降、低概率推理 token 学不到 | DPPO/BandPO/RIPO 类约束 | 固定 ratio clip 对长尾 action 不公平 | token probability 分桶的 clip rate、TV/KL |
| 大规模集群扩 batch | 平方根 LR scaling 后再比较 | 吞吐收益可能被 sample penalty 抵消 | throughput、samples-to-target、time-to-target |
一个实用的实验顺序是:
- 先固定 reward、数据、rollout 数和训练 token budget,建立 PPO 与 GRPO/RLOO 两条可复现基线;
- 检查 critic EV、校准误差、zero-advantage group、entropy、clip fraction 和 training-inference mismatch;
- 根据真正暴露的瓶颈,只替换 baseline、credit、trust region 或 rollout pipeline 中的一项;
- 除最终 accuracy 外,同时报告 wall-clock、rollout tokens、峰值显存和多随机种子方差;
- 最后再做组件组合,否则很难知道性能来自算法还是预算变化。
8. 当前证据的局限
8.1 数学 benchmark 过度集中
大量 2026 工作主要在 Qwen/DeepSeek 蒸馏模型与 AIME、AMC、MATH、HMMT 上验证。数学 verifier 干净、reward 便宜,但它不能代表开放式写作、事实性、安全对齐和真实用户偏好。一个在二元终局奖励上有效的 advantage estimator,未必能承受 noisy reward model。
8.2 “公平比较”仍然很难
PPO、GRPO 及其变体常常同时改变:每题 rollout 数、是否训练 critic、最大生成长度、是否做 dynamic sampling、loss normalization、KL、entropy、batch size 和硬件并行。只看最终 benchmark 表,容易把更多采样或不同 token budget 误认为算法改进。
8.3 许多结论仍来自单篇预印本
DPPO、CTPO、EVPO、RIPO、SAPO 等提出了很强的机制性解释和实验结果,但截至本文日期,大量结论尚缺少不同代码库、不同模型家族和独立团队的复现。特别是“高达多少百分比”的相对提升,往往依赖弱基线、较小样本或特定训练 recipe,不应脱离实验设置传播。
8.4 Credit assignment 的因果性仍未解决
segment boundary、critic discrepancy、gradient influence 和 sibling branching 都比全轨迹同奖更细,但只有可恢复状态上的受控分叉最接近局部因果比较。对于纯文本 CoT,中间步骤通常不能被环境真正执行,模型也可能在错误步骤后自我纠正;“低概率 token 是语义边界”或“参考答案差异大就是关键状态”都仍是启发式假设。
8.5 Long-Horizon benchmark 存在明显的场景集中
Turn/step-level 工作高度集中在 ALFWorld、WebShop、Sokoban、Search-QA 与 BrowseComp 系列。它们覆盖了文本交互、网页购物、游戏和搜索,但对真实软件工程、持续数小时的浏览器任务、含噪机器人环境和不可逆操作覆盖不足。同一算法在确定性文本环境中的局部 reward,不一定能迁移到 observation aliasing、环境延迟和安全约束更强的真实系统。
8.6 Privileged credit 可能掩盖部署差距
gold answer likelihood、ground-truth trace、game solver、强 verifier 和 hindsight teacher 都能显著降低训练难度,但这些信息的成本与可用范围差异很大。未来论文应把“优化器收益”和“额外监督收益”拆开,报告去除 privileged signal 后的性能,并核算生成过程标签所消耗的模型调用与算力。
8.7 SMOPD 的扩展性仍待验证
SMOPD 的实验都只有两个 reward dimension。若扩展到 \(K\) 个目标,Stage 1 通常需要多个 specialized teacher,Stage 2 的每个 student token 又需要冻结教师前向计算;训练成本、教师存储和 top-\(\kappa\) 通信会随教师数增加。priority profile 仍是手工设置,且实验未给出与单阶段 baseline 严格等算力的比较。工具调用的 in-domain test 只有 80 个 prompt,API-Bank 主结果还对 exact-match failure 使用 LLM judge。因此,论文很好地证明了“reward density imbalance 确实存在”,但多目标规模化、评估器偏差和计算收益比仍需独立验证。
9. 未来最值得跟踪的方向
9.1 可学习而非手工设定的 trust region
当前 DPPO、BandPO、CPPO、RIPO 主要设计更合理的阈值或几何,但阈值仍是超参数。下一步可能根据模型置信度、token 位置、reward uncertainty、policy staleness 和历史崩溃信号动态分配 divergence budget。
9.2 Critic、verifier 与 world model 的融合
critic 只估计“当前 policy 下的未来回报”,verifier 判断结果,world model 预测动作后果。长程 Agent 需要三者共享状态表征但保持目标可辨识,否则 value 学习仍会被稀疏终局 reward 限制。
一个尤其值得追踪的问题是 score-to-credit calibration:如何判断 verifier 分数变化真的是当前动作造成的,而不是历史状态、评估噪声或答案泄漏。TRACE、TCPO、HCAPO 与 AgentOPSD 已经给出不同答案,但尚缺统一的、带局部反事实真值的 benchmark。
9.3 从文本轨迹到可分叉环境
BPO 展示了 sandbox snapshot 对局部 baseline 的价值。代码执行、浏览器、游戏、操作系统和机器人模拟器都可以保留中间状态;未来 Agent RL 的数据单元可能不再是一条完整 trajectory,而是“状态节点 + 多个候选 action + 可比较 continuation”。
9.4 算法与系统共同给出 scaling law
batch、rollout 并发、policy staleness、模型更新频率与 GPU placement 彼此耦合。只研究 sample efficiency 或单步吞吐都不够,真正可用的 scaling law 应直接预测在固定算力和 wall-clock 下达到目标能力的最优组合。
10. 读者应记住的要点
- PPO 在 2026 年仍是大模型在线 RL 的底层语法;GRPO 更像是去 critic 的 PPO 分支,而不是完全不同的世界。
- critic-free 方法适合单轮、可验证、可并行多采样的推理任务;多轮 Agent 更需要状态条件 baseline 与时间信用分配。
- Long-horizon 的关键分界不是上下文有多长,而是环境是否在动作之间改变状态;有状态交互应优先采用 turn-level MDP。
- dense reward 只是观测到更多分数,turn-level credit 还必须衡量每个动作带来的进展;score-to-credit conversion 是 2026 年最明确的新主线。
- Turn-PPO、Odysseus 与 SAPO 表明 critic 在昂贵的长轨迹中重新有竞争力;GiGPO、ECPO、BEACON、TRACE 等则用局部比较或潜势函数补回 critic-free 方法缺失的状态信息。
- 多奖励优化中,逐维标准化只能解决 reward scale,不能解决 reward density;SMOPD 表明“先获得各维能力、再用 OPD 合并”是单策略标量化之外的新路线,但目前只验证到两个 reward。
- 固定 ratio clipping 对 LLM 长尾词表存在结构性问题,distribution-aware、probability-aware、position-aware trust region 是最密集的算法前沿。
- 信用粒度正从 token 扩展到 segment、sequence、turn 和 branch;粒度必须与任务真实的因果结构匹配。
- rollout 已成为算法本身:筛选、提前终止、前缀反传、状态分叉、单 rollout 和异步 correction 都会决定最终效果。
- 评估新 PPO 变体时,必须同时看 accuracy、稳定性、entropy、tokens-to-target、time-to-target、显存和多 seed 方差。
- 目前最稳妥的结论不是“某个新缩写已经统一取代 PPO”,而是:PPO 正在被模块化重构,未来主流会是按任务动态组合 critic、credit、correction 与 trust region 的混合系统。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。