2026 年大模型 PPO:前沿进展、主流范式与论文地图

更新日期:2026-09-07 关键词:PPO、RLHF、RLVR、GRPO、Critic、Trust Region、LLM Agent、Long-Horizon、Turn/Step-Level Credit Assignment

写在前面

如果只看算法名称,2026 年的大模型强化学习似乎已经从 PPO 转向了 GRPO、DAPO、GSPO 和各种 -PO。但从目标函数看,事情并没有这么简单:大量所谓新算法仍保留 PPO 的核心骨架——使用旧策略采样、计算 advantage、用 importance ratio 修正策略变化,再通过 clipping、mask、KL 或其他 divergence 控制更新幅度。

真正发生的变化,是研究者开始把 PPO 拆成几个可以独立替换的部件:

  1. 反馈从哪里来:人类偏好奖励模型、规则验证器、环境奖励还是过程反馈;
  2. baseline 如何估计:独立 critic、组内均值、历史统计、轻量 probe,还是共享 actor 的内部状态;
  3. 信用分配到哪一层:token、segment、完整 sequence、Agent turn,还是可恢复环境中的 branch;
  4. 策略更新如何受约束:固定 ratio clipping、直接 divergence、位置相关预算、累计 prefix 约束或黎曼几何;
  5. rollout 如何生产和消费:全量训练、筛选、提前终止、前缀反传、单 rollout、异步采样或大 batch。

本文的核心判断是:PPO 没有消失,而是从一个固定的 actor–critic 算法,演化成了大模型在线策略优化的一套模块化设计空间。2026 年最重要的前沿,不是再给 PPO 换一个缩写,而是让 trust region、advantage 和 credit assignment 真正适配长文本、长尾词表与多轮环境。

本文只收录大模型后训练中的 PPO 及其直接近邻;通信、机器人、调度等“仅把 PPO 当作现成优化器”的应用论文不在范围内。论文检索截至 2026 年 9 月 7 日,并重点补充 long-horizon Agent、turn/step-level PPO、信用分配与多奖励优化。多数工作仍是 arXiv 预印本,实验结果应视为作者报告,而非已经形成的社区共识。

1. 先把 PPO 的坐标系说清楚

给定 prompt \(x\),旧策略或行为策略 \(\pi_{\mathrm{old}}\) 生成回答

\[ y=(y_1,\ldots,y_T), \]

奖励函数给出回报 \(R(x,y)\)。PPO 对第 \(t\) 个 token 使用概率比

\[ r_t(\theta) = \frac{\pi_\theta(y_t\mid x,y_{<t})} {\pi_{\mathrm{old}}(y_t\mid x,y_{<t})}, \]

并优化 clipped surrogate:

\[ L_{\mathrm{PPO}} = \mathbb E_t\left[ \min\left( r_t\hat A_t, \operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t \right) \right]. \]

这里有两个经常被混淆的“不要走太远”:

  • PPO clipping / trust region 比较当前训练策略与产生 rollout 的行为策略,主要解决同一批数据被重复更新、异步 rollout 和训练—推理引擎不一致造成的 off-policy 问题;
  • reference KL 比较当前策略与冻结的 SFT/reference model,主要防止能力漂移、语言退化和 reward over-optimization。

二者可以同时存在,也不能互相替代。2026 年很多工作正是在重新设计第一种约束。

1.1 PPO 与 GRPO 到底是什么关系

在稀疏终局奖励的 RLVR 中,标准 PPO 通常用 value model 估计

\[ \hat A_t^{\mathrm{PPO}}=R-V_\phi(s_t), \]

而 GRPO 对同一 prompt 采样 \(G\) 条回答,用组内统计量构造

\[ \hat A_i^{\mathrm{GRPO}} = \frac{R_i-\operatorname{mean}(R_{1:G})} {\operatorname{std}(R_{1:G})}. \]

随后,GRPO 仍把这个 sequence-level advantage 广播到 token,并常常继续使用 PPO 式 ratio clipping。也就是说:

GRPO 主要替换了 PPO 的 critic 和 advantage estimator,而没有自动解决 PPO clipping、off-policy correction 与长程信用分配的问题。

因此,把 GRPO、DAPO、GSPO 等完全放到“PPO 的对立面”会错过 2026 年论文之间最重要的继承关系。

2. 2026 年的主流范式

2.1 经典 critic-based PPO:仍是需要状态价值时的强基线

经典 PPO 使用独立 value model 和 GAE,对每个 token 或状态给出不同 advantage。它的优势是能够做状态相关的时间信用分配,尤其适合:

  • 多轮 Agent 与环境交互;
  • 中间动作会改变后续可达状态的任务;
  • 奖励延迟、轨迹很长、同一 prompt 的不同中间状态价值差异很大;
  • 不能靠大量同 prompt rollout 稳定估计组内均值的场景。

代价也很直接:一个接近 policy 规模的 critic 会增加显存、前向与反向成本;在 RLVR 的稀疏二元奖励下,中间状态 value 很难学,错误 critic 反而会放大 advantage 方差。

2026 年的关键变化不是简单恢复大 critic,而是让 critic 更容易学、更便宜、更可校准,并且只在它确实有用时使用

  • SAE 只在低概率 token 标出的语义边界进行 bootstrap,减少 GAE 在每个 token 累积 value bias;
  • DFPO 用 distributional value flow 表达更丰富的价值分布,面向 noisy reward 与 OOD 泛化;
  • EVPO 用 explained variance 判断当前 critic 是降方差还是增方差,并在 PPO baseline 与 batch-mean baseline 间切换;
  • POISE 从 actor 的 hidden states 与 entropy 统计中训练轻量 value probe,避免复制一个 policy-scale critic;
  • SR-PPO 用 Monte Carlo Pass@\(k\) critic 做单 rollout、token-level credit assignment;
  • ReDiPPO 训练时用参考答案校准 critic,并用 reference critic 与普通 critic 的差异识别困难 token;
  • HL-Gauss PPO 把 scalar MSE critic 改成离散 value support 上的分类器,再解码期望值供标准 GAE 使用。

这条路线的共识正在变成:critic 不是一定要删掉,而是不能再被当作一个默认正确的黑盒回归器。

2.2 Critic-free PPO/GRPO:单轮可验证推理的默认工程范式

数学、代码与规则可验证任务通常只有终局 reward,但同一题可以并行采样多条答案。在这个设定下,GRPO/RLOO 类方法用组内或 leave-one-out baseline 代替 critic,具有明显的工程优势:

  • 不需要加载和训练第二个大模型;
  • 训练栈简单,容易扩展到大 policy;
  • 对单轮、二元可验证奖励往往有竞争力;
  • 多条 rollout 同时提供探索与 baseline 估计。

它的主要风险是:全对或全错的 group 会产生零方差甚至零 advantage;困难 prompt 的组均值噪声很大;同一个 sequence-level advantage 被广播到所有 token;每题多采样又把成本转移到了 rollout。

2026 年的改进包括:

  • BV-Blend 把 prompt-local 统计与语义簇的历史 reward moments 按不确定性混合,缓解全对/全错组的 advantage collapse;
  • PS-PPO 对每条回答随机采样 cutoff,只对 prefix 反传,并用 \(1/\xi_t\) 重要性权重保持梯度期望无偏;
  • SPPO 保留一个只预测题目可解性的轻量 sequence-level critic,以单样本替代 GRPO 的同题多采样;
  • I-PPO 在 PPO 更新前用梯度归因过滤与验证方向反对齐的 rollout。

2.3 混合与自适应范式:PPO 和 GRPO 不再是二选一

EVPO 给出了一个很有代表性的统一视角。对 terminal reward \(G\),PPO 与 GRPO 都可以写成

\[ \hat A_t=G-b(s_t), \]

区别只在 baseline:PPO 使用 \(V_\phi(s_t)\),GRPO 使用 batch mean。EVPO 计算

\[ \widehat{\mathrm{EV}} = 1- \frac{\operatorname{Var}(G-V_\phi(s))} {\operatorname{Var}(G)}. \]

\(\widehat{\mathrm{EV}}>0\) 时,critic 比常数 baseline 解释了更多回报方差;当 \(\widehat{\mathrm{EV}}\le 0\) 时,critic 的误差比它捕获的状态信号更大。于是可以按训练 step 切换:

\[ b(s_t)= \begin{cases} V_\phi(s_t),&\widehat{\mathrm{EV}}>0,\\ \bar G,&\widehat{\mathrm{EV}}\le 0. \end{cases} \]

作者在 Sokoban、FrozenLake、WebShop 和 MATH 上报告 EVPO 均超过固定 PPO 与 GRPO;例如验证成功率分别为 0.604、0.684、0.303 和 0.416,而 PPO 为 0.314、0.611、0.252 和 0.373。这个结果最值得记住的不是具体分数,而是设计原则:baseline 应随 critic 的成熟度、任务与训练阶段自适应。

SMOPD:多奖励不只需要归一化,还需要先专门化再合并

SMOPD 补充了另一种“混合”含义:不是在 PPO 与 GRPO 之间切换,而是在多个不同密度、甚至彼此冲突的 reward 之间保留能力。更完整的公式推演、实验与局限分析见独立文章《SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并”》。

标准 GRPO 先把各 reward 相加,再对总分做组内标准化,容易发生 reward masking。GDPO 已经改为逐维标准化后加权:

\[ \hat A_i^{(k)}= \frac{r_i^{(k)}-\mu^{(k)}}{\sigma^{(k)}+\epsilon}, \qquad \hat A_i^{\text{GDPO}} \propto \sum_{k=1}^{K}w_k\hat A_i^{(k)}. \]

但逐维归一化只能解决“尺度不同”,无法凭空制造“组内差异”。论文给出的例子是:8 个 prompt group、每组 4 条 rollout;dense reward 在每组都是 \([0,1,2,3]\),而 binary sparse reward 在 7 组中都是 \([0,0,0,0]\),只有 1 组出现 \([1,0,0,0]\)。后者在七八的 group 中方差为零,即使权重平衡也几乎不给梯度。

SMOPD 因而采用两阶段训练:

  1. Specialize:从同一 base policy 训练多个 reward-specialized teacher。以 accuracy/format 为例,分别使用 \([0.9,0.1]\)\([0.1,0.9]\) 的 reward priority;由于逐维 advantage 已同尺度,目标 reward 获得约 9 倍的相对梯度权重。
  2. Merge:student 在自己的 on-policy rollout 上生成 prefix;冻结的教师为每个 token 给出 top-\(\kappa\) 分布,均匀混合为 \(p_T^{\text{mix}}\),student 用 mode-covering 的 forward KL 学习所有教师的高概率模式。

仅做蒸馏时,student 最多逼近 teacher mixture。SMOPD 因此保留一个等权 GDPO 序列级 anchor:

\[ \mathcal L_{\text{total}} = \mathcal L_{\text{GDPO-anchor}} +\lambda\sum_t \operatorname{KL} \left(p_T^{\text{mix}}(\cdot\mid s_t)\,\|\,p_\theta(\cdot\mid s_t)\right). \]

这里形成了很有代表性的双粒度组合:anchor 回答“整条 response 应上调还是下调”,token-level OPD 回答“XML 边界、工具名和参数位置分别该像哪个教师”。

作者在 Qwen2.5-1.5B 的工具调用实验中报告:相对 GDPO,format pass 从 8.8% 升到 97.5%,RLLA composite 从 1.849 升到 2.740,API-Bank 的 LLM-judge accuracy 从 83.6% 升到 87.1%。在 helpful/harmless 冲突奖励上,Qwen2.5-7B 的 overall 从 GDPO 的 5.498 升到 5.646,并高于两个单独教师;但 Llama-3.2-3B 的 5.590 仍略低于 GD\(^2\)PO 的 5.605,因此证据支持“稳定优于 GDPO”,还不能概括成对所有多奖励 baseline 都占优。

消融进一步说明:去掉 anchor 的 OPD-only 为 5.544,加入 anchor 后为 5.639;top-16 已保留约 99.4% 的 teacher probability mass,\(\kappa=16\) 到 64 的 overall 只差 0.007;sampled-token reverse KL 比 top-16 forward KL 低 0.082。附录中的 sequence/token adaptive gate 也没有稳定超过无参数的均匀 teacher mixing。

这篇论文与 long-horizon credit assignment 是正交关系:它解决的是 reward dimension 之间的 credit 与能力冲突,不是同一条长轨迹中不同 turn 的时间信用。它可以成为 Turn-PPO、GiGPO 或其他 Agent RL 的多奖励上层,但论文目前没有在长程、多轮环境中验证这种组合。

2.4 Sequence/segment/turn/branch:信用分配粒度正在上移

把每个 token 都当作同等重要的 MDP action,在长 CoT 上既昂贵又容易产生虚假的精细度。2026 年形成了四种不同粒度:

粒度 代表方法 解决什么问题 主要风险
Token 经典 PPO、ReDiPPO、HL-Gauss PPO 最细的状态相关 credit critic 难学,长序列误差累积
Segment SAE、SP3O 在语义段落或偏好片段上分配信用 分段边界可能不等于因果边界
Sequence SPPO、SSPO、GRPO/GSPO 与终局 reward 对齐,训练简单 成功轨迹中的坏步骤也被奖励
Turn / Step Turn-PPO、GiGPO、TRACE、SAPO 面向多轮环境和工具调用分配局部信用 需要可比较状态、可靠 value 或过程信号
Branch BPO 在可恢复 sandbox 中构造局部反事实 依赖 snapshot/restore 与额外 continuation

SAE 使用生成概率低于阈值 \(p\) 的 token 作为 segment boundary;段内不衰减 TD error,只在跨段时乘 \(\lambda\)。在 Qwen3-8B、DAPO-Math-17k 上,作者报告四个数学测试集平均分 40.98,高于最强对照 38.89;GRPO 在约 400 step 后不稳定,而 PPO 系方法保持收敛。

SPPO 则把整条推理视为 contextual bandit 的一个 action,只训练 \(V(s_p)\) 预测题目可解性,并把 \(R-V(s_p)\) 广播给序列中的 token。它在 1.5B 模型上用每题一个 rollout 得到 48.06 平均分,作者报告略高于每题 8 个 rollout 的 GRPO 47.08;7B policy 配 1.5B critic 的版本达到 58.56。

两者代表两种不同判断:SAE 认为长序列仍然存在可利用的中间状态,只是不应每个 token 都 bootstrap;SPPO 认为在只有 outcome reward 的数学任务中,强行拟合 token value 可能不如直接退化成 sequence-level bandit。它们不是谁普遍胜过谁,而是对“任务究竟是不是一个可识别的多步 MDP”给出了不同答案。

2.5 Agentic PPO:从初始 prompt baseline 走向状态条件 baseline

对 WebShop、ALFWorld、SWE-bench 这类任务,环境会在每轮动作后改变。此时只按初始 prompt 比较多条完整轨迹,会把早期偶然性、环境反馈和后期动作全部揉成一个 terminal reward。

Branching Policy Optimization 利用 sandbox 可 snapshot/restore 的性质,在高 entropy 中间状态分叉。若同一状态 \(s_t\) 下有 \(K\) 个 sibling rollout,它用 leave-one-out return 构造

\[ \hat A(s_t,a_t^{(k)}) = G_t^{(k)}- \frac{1}{K-1}\sum_{j\ne k}G_t^{(j)}. \]

这比从初始状态独立采样的 GRPO 更接近“控制变量”实验:共享 prefix,只改变后续动作。作者在匹配 rollout 预算下报告 WebShop、ALFWorld、SWE-bench Verified 成功率 67.8%、66.4%、29.8%,对应最佳 baseline 为 63.5%、61.2%、25.1%,并把梯度范数方差降到 GRPO 的约 0.42–0.58。

SAPO 走另一条路线:在同一个 autoregressive backbone 的不同 causal boundary 上同时输出 policy、state value 与 action value,用一条 rollout 做 turn-level GAE,而不加载独立 critic,也不进行 group sampling。作者在 Qwen2.5-7B 上报告 ALFWorld 聚合成功率 94.0%、WebShop 成功率 82.4%,并相对独立 critic PPO 将单次迭代从 451.2 秒降到 301.4 秒。

这里的前沿方向很明确:Agent RL 的有效 baseline 应尽量条件化到真正的环境状态,而不是只条件化到初始 prompt。

3. Long-Horizon 专题:Turn/Step-Level PPO 的研究地图

3.1 先统一术语:长上下文不等于长程决策

这组论文最容易产生的误解,是把 long-context、long-CoT、long-horizon 和 long-term memory 混成一件事。它们对应的瓶颈并不相同:

概念 核心含义 环境是否在中途反馈 PPO 的主要难点
Long-context 模型一次可读取很多 token 不一定 显存、attention 与 position generalization
Long-CoT 单次回答包含很长推理链 通常否 token/segment credit 与长序列 importance ratio
Long-horizon 完成任务需要很多次动作—观察循环 探索、延迟奖励、状态价值与跨步信用分配
Long-term memory 信息跨任务或跨 session 持久化 memory update 对未来任务的延迟影响

本文约定:一个 turn 是 LLM 在一次环境反馈前生成的完整响应,一个 environment step 是环境执行一次动作并返回新观察。当每个 turn 只产生一个工具调用时,两者等价;若一个响应包含多个动作,或环境内部执行多个低层控制步,turn 与 step 就不再相同。token 则是 turn 内部的自回归微动作。

因此,一条 Agent 轨迹可写成

\[ \tau=(s_0,u_0,r_0,s_1,u_1,r_1,\ldots,s_H), \]

其中 \(s_k\) 是包含任务、历史观察、memory 与工具状态的 turn-boundary state,\(u_k=(y_{k,1},\ldots,y_{k,L_k})\) 是第 \(k\) 个 turn 的文本动作。Turn-level PPO 并不是停止训练 token,而是在 turn 边界估计 credit,再把同一个 turn 的 advantage 分配给该 turn 内可学习的 token。

3.2 为什么 trajectory-level PPO/GRPO 会随 horizon 失效

最常见的多轮 GRPO 实现只在任务结束时得到 \(R(\tau_i)\),再对同一任务的多条轨迹做组内标准化:

\[ A_i^{\text{traj}} = \frac{R(\tau_i)-\operatorname{mean}_{j}R(\tau_j)} {\operatorname{std}_{j}R(\tau_j)+\epsilon}, \qquad A_{i,k}=A_i^{\text{traj}}\;\;\forall k. \]

这会把一条成功轨迹中的冗余、无效甚至错误动作一并奖励,也会把失败轨迹中已经完成的子目标全部惩罚。horizon 增大后,问题会同时从五个方向恶化:

  1. 探索概率快速下降:若每一步独立正确的概率近似为 \(p\),完整成功率按教学近似会缩到 \(p^H\);全零 reward group 随之增多。
  2. 时间混叠:早期好动作可能被最后一步失败覆盖,晚期补救动作也可能被早期幸运状态“搭便车”。
  3. baseline 错位:只条件化初始 prompt 的组均值,不知道 agent 在第 \(k\) 步实际到达了哪个环境状态。
  4. 有效样本浪费:失败轨迹中的局部进展无法被学习;长轨迹越贵,这种浪费越严重。
  5. 系统偏移累积:长 rollout 加剧 policy staleness、上下文截断、工具错误和 trainer–inference mismatch。

On Training Large Language Models for Long-Horizon Tasks 用“只改变所需步数、尽量保持规则和推理结构不变”的受控任务验证:horizon 本身就是训练瓶颈。作者还发现,使用高层动作或子目标缩短有效 horizon,不仅稳定训练,而且能产生从短 horizon 到长 horizon 的泛化。这意味着信用分配并不是唯一解;重新设计 action abstraction 可能比发明更复杂的 estimator 更有效。

3.3 五类主流范式

3.3.1 Critic-based turn MDP:把 GAE 放到环境边界

这是最直接、也最接近经典 PPO 的路线。critic 不再给每个 token prefix 拟合一个 value,而是在环境真正改变的 turn boundary 上估计 \(V(s_k)\)

\[ \delta_k=r_k+\gamma V(s_{k+1})-V(s_k), \qquad \hat A_k=\sum_{l=0}^{H-k-1}(\gamma\lambda)^l\delta_{k+l}. \]

随后用 \(\hat A_k\) 更新 turn \(u_k\) 内的 policy token。其优势是 baseline 与真实状态对齐,计算图也不必在环境 observation token 上反传。

  • Fine-Grained Reward Structure and Credit Assignment 的 2026 年 8 月修订版系统区分 terminal、delayed 与 per-turn reward,并分别推导 multi-turn PPO/GRPO。作者报告 dense per-turn PPO 在搜索任务上更稳定、收敛更快。
  • Turn-PPO 直接把一整个 turn 视作 MDP action,在 WebShop 和 Sokoban 上发现 PPO 比直接移植的 GRPO 更稳;该工作已发表于 EACL 2026。
  • Odysseus 把轻量 turn-level critic 扩展到视觉游戏中的 100+ turn 决策,并报告其稳定性和样本效率优于 GRPO 与 Reinforce++。
  • SAPO 进一步把 policy、\(V\)\(Q\) 放进同一自回归 backbone,在保持状态条件 baseline 的同时避免独立 critic 与 group rollout 的成本。

这条路线最适合“环境状态真的变化、单条 trajectory 很贵、未来回报可由当前状态预测”的任务。它的软肋仍是 critic calibration:部分可观测、历史过长或 reward 极稀疏时,\(V(s_k)\) 可能只是在拟合轨迹长度和表面模式。

3.3.2 Critic-free 局部比较:只比较可比的状态与动作

另一条路线保留 GRPO 的 critic-free 优点,但把比较单位从整条 trajectory 下沉到局部状态。

GiGPO 的核心是两层 advantage:trajectory group 给出 macro credit,重复到达同一 anchor state 的动作组给出 micro credit。概念上可写成

\[ A_{i,k}=A_i^{\text{episode}}+\alpha A_{i,k}^{\text{anchor}}. \]

它在 ALFWorld 与 WebShop 上相对 GRPO 分别报告超过 12% 和 9% 的提升,并且不增加 rollout。但“相同状态”样本少时,局部均值会被幸运动作支配。ECPO 因此按 canonical action 聚合,并对低计数估计做 shrinkage,再用方差门控压低噪声 anchor 的权重;作者报告在 1.5B 模型上相对 GiGPO 提升 ALFWorld 5.2、WebShop 7.3 个成功率百分点。

同一族还有三种任务特化形式:

  • TL-GRPO 面向“每轮在同一底层对象上迭代、最终看 best-turn reward”的优化任务,在模拟预算固定时进行 turn-level group sampling;
  • MatchTIR 将预测工具轨迹与 ground-truth trace 做二分图匹配,再融合 turn 与 trajectory 两级 advantage;
  • MemoPilot 用 context-independent turn advantage 训练 memory updater,而冻结实际执行任务的 LLM,说明 turn-level RL 也可以优化跨轮记忆而非直接优化动作策略。

这类方法的关键不是“没有 critic”,而是是否真的找到了条件足够接近的 comparison set。若状态哈希、动作 canonicalization 或重复访问率不可靠,micro advantage 只是把 trajectory 噪声换成了小样本噪声。

3.3.3 Reward shaping 与 potential:把结果分数转换成进展

很多环境能在每轮产生一个 score,但 dense score 不等于 dense credit。score \(q_k\) 表示当前状态有多好,credit 应表示动作让状态变好了多少。最经典的安全形式是 potential-based shaping:

\[ \tilde r_k=r_k+\gamma\Phi(s_{k+1})-\Phi(s_k). \]

2026 年最密集的新工作几乎都在设计不同来源的 \(\Phi\) 或 score-to-credit 转换:

  • BEACON 用任务 milestone 切分轨迹,在 segment 内做 temporal shaping,并融合局部与全局 advantage。作者在 long-horizon ALFWorld 上报告 92.9% 成功率,对比 GRPO 的 53.5%;有效样本利用率从 23.7% 提升到 82.0%。
  • TRACE 在工具调用边界计算冻结参考模型对 gold answer 的 log-probability,以 log-ratio 状态值的 TD 差作为 action reward,不训练额外 critic。作者在 BrowseComp-Plus 上把 Qwen3-4B 从 7.2 提升到 35.6、Qwen3-30B-A3B 从 8.4 提升到 42.6。
  • SIOP 在没有 verifier 或 gold answer 时,把多条 rollout 的最终答案聚成语义 outcome modes,以模型自己对可靠 outcome cluster 的后验提升构造 turn potential。
  • TCPO 针对 iterative refinement,结合相对历史最佳状态的即时进退、延迟 hindsight credit,以及只在高 surprisal turn 上执行的 fixed-history counterfactual。
  • CAST 直接使用游戏 solver 的 state-value change 作为 turn advantage;在 soft-optimal 假设下,这等价于只传标量 value 的 on-policy solver distillation。
  • ABSeeker 从 gold answer 反向恢复中间 clues,再据此给搜索 step 打分,并分别形成 ABC-SFT 与 ABC-GRPO。

这条范式最强,但也最容易产生隐藏的数据泄漏:gold answer、ground-truth trace、solver 或强 verifier 若在训练时可用而部署时不可用,方法提升可能来自 privileged supervision,而不只是更好的 PPO。

3.3.4 Hindsight、动态模型与自蒸馏:事后识别关键一步

有些动作只有看到后续结果才知道价值,局部即时 reward 无法判断。于是研究开始使用完整 future 做后验 credit:

  • HCAPO 让 LLM 在轨迹结束后充当 critic,hindsight 修正 step-level \(Q\),再用 multi-scale advantage 补足中间状态 baseline;作者在 Qwen2.5-7B 上相对 GRPO 报告 WebShop +7.7、ALFWorld +13.8 个百分点。
  • SHADOW 先按 transition dynamics 约束可比较状态,再用局部动态与 GAE 分配 action credit,避免把表面相似但后继分布不同的状态混为一组。
  • AgentOPSD 把 privileged teacher 与 student 的 token log-probability gap 聚合成 turn evidence,再在 log-odds 空间递归更新 belief;它不需要额外 critic 或 rollout,并在 Qwen2.5-7B/ALFWorld 上报告 89.1% 成功率。

Hindsight 的优点是能识别“当时看似普通、后来证明关键”的动作;风险是 post-hoc rationalization。一个会讲故事的 LLM critic 不一定在估计因果贡献,因此必须加入状态分叉、动作替换或人工标注的小规模因果校准集。

3.3.5 Branch counterfactual 与层级解耦:改变训练数据的基本单位

如果环境支持 snapshot/restore,最干净的局部 baseline 不是猜 value,而是在同一状态执行多个 candidate action。BPO 就是在高 entropy 中间状态分叉,用 sibling continuation 构造 leave-one-out advantage。代价是额外环境执行,但比较的因果含义明显强于从初始 prompt 独立采样。

Agent Lightning 则从系统接口解决问题:把复杂 Agent 的执行日志分解为独立 transition,由 credit module 给每次 LLM call 分配 reward,再交给 PPO、GRPO 等任意单步优化器。这提示了一个更长期的主流形态:Agent runtime 负责状态、观测与因果边界,policy optimizer 只消费标准化的 step transition。

3.4 最新论文时间线:2025 奠基,2026 转向精细信用

下表只列与 long-horizon、turn/step-level policy optimization 直接相关的工作。PPO 关系表示它是否直接使用 actor–critic PPO,或使用保留 PPO clipped surrogate 的 GRPO 近邻。

时间 论文 PPO 关系 Credit 粒度与新增能力 主要实验场景
2025-05 GiGPO GRPO/PPO 近邻 episode + anchor-state step advantage ALFWorld、WebShop、Search-QA
2025-05 / 2026-08 v3 Fine-Grained Reward Structure and Credit Assignment MT-PPO + MT-GRPO terminal/delayed/per-turn reward 统一推导 多轮搜索、游戏
2025-08 Agent Lightning 可接 PPO/GRPO 将任意 Agent 轨迹分解成训练 transition Text-to-SQL、RAG、工具数学
2025-08 Long-Context Multi-Turn SWE Agents modified DAPO 多轮有状态环境中的长上下文 RL SWE-bench Verified、SWE-rebench
2025-10 Practitioner’s Guide to Multi-turn Agentic RL 比较 PPO/GRPO/RLOO 环境、reward sparsity、policy 联合消融 TextWorld、ALFWorld、SWE-Gym
2025-12 / EACL 2026 Turn-PPO 直接 PPO turn-level MDP 与 advantage estimation WebShop、Sokoban
2026-01 MatchTIR clipped policy optimization trace matching + turn/trajectory dual advantage 工具集成推理
2026-01 TL-GRPO GRPO/PPO 近邻 对同一优化对象做 turn group sampling 模拟电路 sizing
2026-03 HCAPO GRPO/PPO 近邻 hindsight step-\(Q\) + multi-scale advantage ALFWorld、WebShop 等
2026-03 SHADOW GAE/PPO 系 dynamics-aware state group + local GAE ALFWorld、WebShop
2026-05 Odysseus 直接 PPO lightweight turn critic 扩展到 100+ turns Super Mario Land、跨游戏泛化
2026-05 Horizon Length Study 方法诊断 控制变量证明 horizon 本身造成不稳定 Sudoku、Rush Hour、网页导航
2026-05 SIOP 可接 group policy optimization 无 verifier 的 outcome-cluster potential 7 个搜索增强推理基准
2026-05 BEACON GRPO/PPO 近邻 milestone segment + dual-scale advantage ALFWorld、WebShop、ScienceWorld
2026-06 ECPO critic-free clipped PO 小样本 shrinkage + variance-gated step credit ALFWorld、WebShop
2026-06 MemoPilot multi-turn GRPO turn-wise reward 优化跨轮 memory update 扑克、石头剪刀布
2026-07 TRACE 可接标准 policy update answer log-ratio potential 的 turn TD reward BrowseComp-Plus、开放网页搜索
2026-07 CAST RLVR/PPO 近邻 solver value difference 作 turn teacher Sokoban、Minesweeper、Rush Hour
2026-08 TCPO turn-level clipped PO score-to-credit + selective counterfactual 数学、代码、AppWorld
2026-08 ABSeeker ABC-GRPO answer-backtracked clue reward BrowseComp、BrowseComp-ZH
2026-08 AgentOPSD 可接标准 policy optimization recursive self-distillation turn credit ALFWorld、WebShop、Search-QA

这张时间线显示出一个反转:2024–2025 年的主线是“删掉 critic,扩大 group sampling”;到了 2026 年,长程任务又把研究推回 状态条件 baseline、TD difference、multi-scale advantage 与反事实 continuation。critic-free 没有消失,但它必须用 anchor、milestone、solver、reference model 或 self-distillation 补回状态信息。

3.5 如何选择 Turn/Step-Level PPO

你实际拥有的信号与环境能力 优先起点 原因
每轮有可信 reward,状态可输入 critic MT-PPO / Turn-PPO turn GAE 直接、样本利用率高
单条 rollout 很贵,但状态 value 可预测 Turn-PPO / SAPO / lightweight critic 避免每题大量 group rollout
多条轨迹会重复访问同一状态 GiGPO;小样本时加 ECPO 式校准 能构造局部同状态动作对照
任务有明确子目标或进度节点 BEACON milestone 可隔离远端失败对局部 credit 的污染
有 gold answer,但没有过程标签 TRACE;搜索任务可用 ABSeeker 从答案构造 potential 或反向 clues
每轮有 verifier score,目标是迭代改进 TCPO 显式把 state score 转换为 turn credit
没有 gold answer 和稳定 verifier SIOP 从 rollout outcome cluster 提取自监督 potential
有规则 solver 或可计算 state value CAST 标量 teacher value 比 LLM judge 更可校准
环境可 snapshot/restore BPO 同状态 continuation 提供更接近因果的 baseline
任务超过 100 turns 或包含视觉控制 Odysseus 式 turn critic + action abstraction critic-free group 方法的 rollout 成本和方差更难控制

一个稳妥的默认 recipe 是:先把交互形式化成 turn-level MDP,以 outcome-only PPO/GRPO 为基线;再依次加入 turn-boundary critic、局部 progress reward 与 dual-scale advantage。只有在环境可恢复时,才把昂贵的 branch counterfactual 用于高不确定关键状态。

3.6 Long-Horizon 实验应该怎样做

仅报告最终成功率不足以证明 credit assignment 有效。一个可信实验至少应包含:

  1. 控制 horizon:保持任务规则近似不变,只改变最短成功步数 \(H\),画出 success–horizon 与 variance–horizon 曲线。
  2. 跨 horizon 泛化:在短、中、长三个区间训练并交叉测试,区分“记住训练长度”与真正的 horizon generalization。
  3. 信用质量:在可恢复环境中抽样关键状态,用多个 continuation 近似 action value,测 estimated advantage 的 rank correlation、sign accuracy 与 calibration。
  4. 局部行为指标:报告 invalid-action rate、重复工具调用、子目标完成率、首次错误位置和 turns-to-success,而不只看 terminal reward。
  5. 系统成本:统一统计 environment steps、rollout tokens、额外 verifier/solver/critic FLOPs、峰值显存和 wall-clock time-to-target。
  6. 多 seed 与训练曲线:长程 RL 的主要问题恰是高方差;单 seed 的最佳 checkpoint 没有说服力。

最关键的 ablation 包括:

  • outcome-only、dense score、score difference 与完整 credit estimator 四级对照;
  • token、turn、segment、trajectory 四种 credit 粒度对照;
  • 去掉 global advantage 或 local advantage,检验 dual-scale 是否真的必要;
  • 改变 group size、anchor 最小计数与 critic 容量,观察收益是否只是更多计算带来的;
  • 移除 gold answer、solver、ground-truth trace 等 privileged signal,明确部署时的真实可用条件;
  • 保持总 environment-step 预算一致,避免 branch 或更多 rollout 获得不公平优势。

3.7 当前最可靠的结论

  1. 长程任务应首先建模为 turn-level MDP。 token 仍是优化单元,但不应默认是唯一的信用边界。
  2. critic 在 long-horizon 中重新变得有价值。 当环境状态改变且 rollout 昂贵时,状态条件 value 往往比初始 prompt 下的 group mean 更合适。
  3. 更密的分数不自动等于更好的 credit。 真正关键的是 \(q(s_k)\)\(q(s_{k+1})-q(s_k)\)、hindsight contribution 或 counterfactual advantage 的转换。
  4. 局部与全局信号需要同时存在。 纯局部 reward 容易奖励“格式正确但目标无效”的动作,纯 terminal reward 又无法定位关键决策。
  5. 缩短有效 horizon 是被低估的基线。 高层动作、子目标和 milestone 有时比复杂 advantage estimator 更稳定,也更容易泛化。

4. 2026 年最重要的前沿进展

4.1 从固定 ratio clipping 转向真实的 distributional trust region

PPO 用采样 token 的 ratio 近似策略分布变化。这在动作空间很小的经典控制中可能够用,但 LLM 的词表巨大且长尾。考虑一个教学用简化例子,clipping 区间为 \([0.8,1.2]\)

token 旧概率 新概率 ratio 绝对概率变化 PPO 判断
稀有 token \(10^{-4}\) \(10^{-2}\) 100 0.0099 强制 clipping
高频 token 0.99 0.80 0.808 0.19 可能仍放行

第一个更新的 ratio 很大,但只移动了不到 1% 概率质量;第二个 ratio 接近 clipping 下界,却移动了 19% 概率质量。固定 ratio 因而会过度惩罚可能带来新推理路径的低概率 token,同时低估高概率 token 的破坏性变化。

DPPO 用 TV/KL divergence 是否超过阈值来决定 mask,并提供 binary 与 Top-\(K\) 近似以避免保存完整词表分布。作者还发现,训练崩溃往往由不超过 0.5% 的“坏更新”触发:它们对负样本中的高概率 token 施加过大的反向移动。DPPO 在 RLHF 设置中也报告了更快 reward 提升,并在 Qwen3/AlpacaEval 2.0 上得到 80.90 的 length-controlled win rate。

这一主线随后迅速分化:

  • BandPO\(f\)-divergence trust region 投影为与旧概率相关的动态 clipping band;
  • DRPO 用平滑、advantage-weighted quadratic regularizer 替代越界后直接丢弃梯度的 hard mask;
  • CPPO 认为 early token 的偏移会影响更长 suffix,因此给早期位置更紧的预算,并累积约束 prefix divergence;
  • Predictive Divergence Masks 不再用 \(\hat A(r-1)\) 判断更新朝向,而是直接预测一次 policy-gradient step 会让 divergence 增大还是减小;
  • RIPO 从策略分布的黎曼几何出发,令 clipping boundary 随旧概率变化,以减少长尾探索 collapse;
  • ERPO 把部分 regularization 从 response policy 移到训练 query distribution,用 Query-KL 控制输入侧漂移,以保留 action-side exploration。

我的判断是,固定 \([1-\epsilon,1+\epsilon]\) ratio clipping 正在从“默认正确的 PPO 核心”退化为一个可用但粗糙的工程近似。下一代主流实现很可能仍保留 PPO 式一阶更新,却改用 probability-aware、divergence-aware 和 position-aware 的约束。

4.2 Importance sampling 从单 token 走向 prefix 与多步修正

标准 PPO/GRPO 的 token ratio 只修正当前 action 的概率,没有修正到达当前 prefix 的状态分布:

\[ r_t= \frac{\pi_\theta(y_t\mid y_{<t},x)} {\pi_b(y_t\mid y_{<t},x)}. \]

理论上,位置 \(t\) 的 state-action mismatch 应包含整个 prefix:

\[ \rho_t^{\mathrm{cum}} = \prod_{j=1}^{t} \frac{\pi_\theta(y_j\mid y_{<j},x)} {\pi_b(y_j\mid y_{<j},x)}. \]

但整条 sequence ratio 又会因为大量乘法产生极高方差。2026 年工作的共同目标,是在局部低方差和全轨迹无偏之间找连续中间点:

  • CTPO 使用 cumulative-token ratio,并随位置收紧 clipping;作者在 Qwen3-4B/14B 的四个竞赛数学基准上报告平均 51.4/58.8,高于 GRPO 的 43.2/54.6 与 GSPO 的 47.7/55.5;
  • NFPO 使用未来 \(N-1\) 个 token 的 likelihood-ratio trace,在 PPO 局部 surrogate 与 exact policy gradient 之间连续插值;
  • SSPO 在 sequence-level importance weight 内加入基于 token ratio 的 soft gate;
  • R\(^2\)VPO 约束 ratio variance,用“soft brake”保留高回报、高 divergence 的探索样本,并允许复用 stale data;
  • Missing Old Logits 指出异步 Agent RL 若丢失历史 trainer logits,会把训练—推理差异与 policy staleness 混为一个 ratio,并系统比较 old-logit 恢复策略。

这条路线的重要性不只在公式。只要 rollout engine 与 trainer 分离、一个 batch 被训练多轮或流水线异步运行,LLM RL 就不是理想化的严格 on-policy 算法;off-policy correction 已经成为系统语义的一部分。

4.3 Rollout 不再是“先全部生成,再全部训练”的固定数据管道

长 CoT 和多轮 Agent 的最大成本常常是 rollout,而不是一次 loss 计算。2026 年论文开始直接优化 rollout 的生产、筛选和反传范围:

  • I-PPO 用 rollout gradient 与高质量 validation gradient 的对齐度过滤负 influence episode;
  • ESPO 用采样时已有 logits 构造 surrogate regret,检测不可恢复的错误后把轨迹终止为 absorbing failure state;在 7B 数学模型上,作者报告相对 PPO 平均准确率提高 1.97 个百分点,同时少用约 22% rollout token;
  • PS-PPO 生成完整回答用于 reward,但只对随机 prefix 反传;作者报告每 step 训练时间下降 33%–45%、峰值显存下降 15%–17%,在最大长度 4096 时 update stage 相对 DAPO 加速 3.3 倍;
  • BPO 不再从初始状态重复独立 rollout,而是在高不确定中间状态恢复环境并分叉;
  • When Do Larger Batches Help Scale LLM RL? 区分 sample efficiency 与 systems throughput,发现 Adam 配平方根 learning-rate scaling 可在一定范围内保持 batch-size invariance;GRPO 的生成吞吐最高提高 2.29 倍,但 batch 不重新调参时反而更慢。

前沿系统的优化目标因此不应只是“每 step reward 更高”,而应至少同时报告:

\[ \text{time-to-target},\quad \text{tokens-to-target},\quad \text{peak memory},\quad \text{samples-to-target}. \]

5. 一张图理解主流训练栈

大模型 PPO 系方法可以被统一成下面的流水线:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
SFT / Base policy


rollout:单条、多条、树状分叉、异步或提前终止


feedback:Reward Model / Verifier / Environment / Process signal


baseline:大 critic / 小 critic / actor probe / group mean / history


credit:token / segment / sequence / turn / branch


correction:token ratio / cumulative ratio / N-step trace


trust region:clip / mask / KL-TV / soft regularizer / prefix budget


policy update + 新一轮 rollout

这个视角也解释了为什么只比较“PPO、GRPO、DAPO 谁最好”经常没有意义:两篇论文可能同时改了 baseline、采样数量、credit 粒度、clipping、长度归一化和 batch size,最后的差异无法归因到某一个算法名称。

6. 2026 年代表论文索引

下表按首次 arXiv 提交月份整理,重点收录直接改变大模型 PPO/GRPO 训练机制的工作。它是研究地图,不是穷尽列表,也不代表所有论文已经通过同行评审。

月份 论文 主要问题 一句话方法
01 Segmental Advantage Estimation token GAE bias 用低概率 token 分段,只在段边界衰减 advantage
01 MatchTIR 工具调用被统一分配 trajectory credit trace matching + turn/trajectory dual advantage
01 TL-GRPO iterative optimization 的 best-turn 目标 在 turn 层做 group sampling 与相对优化
02 Rethinking the Trust Region / DPPO ratio 不等于 divergence 用 Binary/Top-\(K\) TV/KL 直接决定 trust-region mask
02 DFPO noisy reward 下的 value modeling 用连续 distributional value flow 建模 critic
02 Soft Sequence Policy Optimization sequence IS 与 hard clip sequence weight 内使用 token-level soft gate
03 BandPO 稀有 token 被固定 clip 压制 \(f\)-divergence 投影成 probability-aware clipping band
03 HCAPO 长程 Agent 的 step-\(Q\) 不准 LLM hindsight critic + multi-scale advantage
04 I-PPO rollout 噪声与不忠实 CoT 用 validation-gradient influence 筛选 episode
04 SPPO critic 成本与长 CoT sequence contextual bandit + 轻量题目价值模型
04 EVPO critic 何时有害 按 explained variance 在 critic 与 batch mean 间切换
05 CTPO token ratio 忽略 prefix mismatch cumulative-token ratio + position-adaptive clip
05 Odysseus VLM Agent 难扩展到 100+ turns PPO + lightweight turn-level critic
05 Horizon Length Study horizon 本身是否造成不稳定 受控改变步数并验证 horizon reduction/generalization
05 SIOP 无 verifier 时的 turn credit outcome cluster 构造自监督 potential
05 BEACON 早期正确动作被末端失败误罚 milestone 分段塑形 + dual-scale advantage
05 POISE policy-scale critic 太贵 用 actor hidden state 和 entropy 训练轻量 probe
05 Missing Old Logits 异步 RL 的 ratio 语义错位 分离训练—推理差异与 policy staleness correction
05 NFPO PPO surrogate 的局部偏差 \(N\)-step forward likelihood-ratio trace 连续调节偏差—方差
05 R\(^2\)VPO hard clipping 丢失发现信号 用 ratio variance regularization 代替二值截断
05 ESPO 错误后继续 rollout 的浪费 在线检测 failure,提前进入 absorbing terminal state
06 DRPO divergence hard mask 丢梯度 对 policy shift 使用平滑 advantage-weighted regularizer
06 ECPO anchor step credit 的小样本偏差 action-level shrinkage + variance-gated weighting
06 MemoPilot memory update 的长程回报 turn-wise reward + context-independent advantage
06 CPPO uniform token trust region 位置权重 + cumulative prefix-divergence budget
06 SR-PPO / Monte Carlo Pass@\(k\) Critic 单 rollout 信用分配 预测 prefix 的 Pass@\(k\) 可达成功概率
06 BV-Blend GRPO 全对/全错组失去信号 混合当前组统计与语义簇历史 moments
06 PS-PPO 长回答反传成本 随机 prefix 反传 + 无偏 importance reweighting
07 RIPO exploration collapse 按策略流形几何设计 probability-dependent clip
07 Predictive Divergence Masks ratio 方向与 divergence 方向不一致 预测梯度 step 对 divergence 的一阶变化
07 TRACE 搜索 Agent 终局 reward 稀疏 gold-answer log-ratio potential 的 turn TD reward
07 Branching Policy Optimization Agent 轨迹 advantage 方差 snapshot 中间状态,以 sibling rollout 作局部 baseline
07 CAST 长程游戏缺少便宜的过程信号 solver state-value difference 作 turn advantage
07 ReDiPPO 数学中间 value 不准 reference-guided critic + discrepancy-aware token reweighting
08 Categorical Critics / HL-Gauss PPO scalar MSE critic 校准差 分类式 value support + 平滑 HL-Gauss target
08 TCPO dense verifier score 不等于 credit retrospective + hindsight + selective counterfactual
08 SP3O 长轨迹偏好反馈太粗 用 segment preference 构造 reward-model-free PPO loss
08 SMOPD dense/sparse reward 的信号密度不平衡 reward-specialized teachers + token OPD + GDPO anchor
08 ABSeeker 搜索失败轨迹中的有效步骤被浪费 answer-backtracked clues 生成 step reward
08 AgentOPSD 关键 turn 难从终局奖励识别 递归 Bayesian self-distillation turn credit
08 SAPO Agent critic 与多 rollout 成本 一个 autoregressive backbone 同时表示 policy、\(V\)\(Q\)
08 ERPO Policy-KL 压制探索 用 Query-KL 在输入侧控制训练分布漂移
08 When Do Larger Batches Help Scale LLM RL? batch 扩展是否真加速 联合建模 samples-to-target 与 generation throughput

另有一篇重要的跨领域理论工作 KLip-PPO:它证明 PPO-Clip 的梯度可等价写成一个 per-sample KL surrogate,系数由该样本的 ratio 与 advantage 决定。论文实验在 MuJoCo 而非 LLM 上,因此不列为 LLM 实证结论,但它支持一个很有用的解释:PPO-Clip 的关键不是“有无 KL”,而是正则强度是否按样本自适应。

7. 如何为不同任务选择范式

场景 更合理的起点 原因 优先观察的诊断量
单轮数学/代码 RLVR,验证器可靠 GRPO/RLOO 类 critic-free PPO 架构简单,多采样兼顾探索 zero-advantage group、entropy、clip fraction
rollout 很贵、prompt 很多 SPPO、POISE、PS-PPO 或单 rollout critic 减少同题重复生成或缩短反传 tokens/time-to-target、critic calibration
长 CoT 但只有 outcome reward SAE 与 sequence-level 方法对照 先判断 segment credit 是否真有用 value error、advantage 与近似真值相关性
多轮工具/网页/游戏 Agent Turn-PPO/SAPO;可分叉时 BPO 状态价值与局部反事实更重要 turn-value calibration、梯度方差、恢复成本
有 milestone、gold answer 或 solver 的长程任务 BEACON/TRACE/CAST/TCPO 可把 privileged signal 转为 turn progress credit calibration、部署时信号可用性
同一任务同时有 dense 与 sparse reward GDPO 基线,再比较 SMOPD 逐维归一化不能修复 sparse reward 的组内零方差 每维 non-zero advantage group、Pareto frontier、教师与蒸馏成本
异步训练或 rollout/trainer 分离 明确 old logits 与 behavior policy correction 的分母语义必须正确 staleness、engine mismatch、bad-update rate
entropy 快速下降、低概率推理 token 学不到 DPPO/BandPO/RIPO 类约束 固定 ratio clip 对长尾 action 不公平 token probability 分桶的 clip rate、TV/KL
大规模集群扩 batch 平方根 LR scaling 后再比较 吞吐收益可能被 sample penalty 抵消 throughput、samples-to-target、time-to-target

一个实用的实验顺序是:

  1. 先固定 reward、数据、rollout 数和训练 token budget,建立 PPO 与 GRPO/RLOO 两条可复现基线;
  2. 检查 critic EV、校准误差、zero-advantage group、entropy、clip fraction 和 training-inference mismatch;
  3. 根据真正暴露的瓶颈,只替换 baseline、credit、trust region 或 rollout pipeline 中的一项;
  4. 除最终 accuracy 外,同时报告 wall-clock、rollout tokens、峰值显存和多随机种子方差;
  5. 最后再做组件组合,否则很难知道性能来自算法还是预算变化。

8. 当前证据的局限

8.1 数学 benchmark 过度集中

大量 2026 工作主要在 Qwen/DeepSeek 蒸馏模型与 AIME、AMC、MATH、HMMT 上验证。数学 verifier 干净、reward 便宜,但它不能代表开放式写作、事实性、安全对齐和真实用户偏好。一个在二元终局奖励上有效的 advantage estimator,未必能承受 noisy reward model。

8.2 “公平比较”仍然很难

PPO、GRPO 及其变体常常同时改变:每题 rollout 数、是否训练 critic、最大生成长度、是否做 dynamic sampling、loss normalization、KL、entropy、batch size 和硬件并行。只看最终 benchmark 表,容易把更多采样或不同 token budget 误认为算法改进。

8.3 许多结论仍来自单篇预印本

DPPO、CTPO、EVPO、RIPO、SAPO 等提出了很强的机制性解释和实验结果,但截至本文日期,大量结论尚缺少不同代码库、不同模型家族和独立团队的复现。特别是“高达多少百分比”的相对提升,往往依赖弱基线、较小样本或特定训练 recipe,不应脱离实验设置传播。

8.4 Credit assignment 的因果性仍未解决

segment boundary、critic discrepancy、gradient influence 和 sibling branching 都比全轨迹同奖更细,但只有可恢复状态上的受控分叉最接近局部因果比较。对于纯文本 CoT,中间步骤通常不能被环境真正执行,模型也可能在错误步骤后自我纠正;“低概率 token 是语义边界”或“参考答案差异大就是关键状态”都仍是启发式假设。

8.5 Long-Horizon benchmark 存在明显的场景集中

Turn/step-level 工作高度集中在 ALFWorld、WebShop、Sokoban、Search-QA 与 BrowseComp 系列。它们覆盖了文本交互、网页购物、游戏和搜索,但对真实软件工程、持续数小时的浏览器任务、含噪机器人环境和不可逆操作覆盖不足。同一算法在确定性文本环境中的局部 reward,不一定能迁移到 observation aliasing、环境延迟和安全约束更强的真实系统。

8.6 Privileged credit 可能掩盖部署差距

gold answer likelihood、ground-truth trace、game solver、强 verifier 和 hindsight teacher 都能显著降低训练难度,但这些信息的成本与可用范围差异很大。未来论文应把“优化器收益”和“额外监督收益”拆开,报告去除 privileged signal 后的性能,并核算生成过程标签所消耗的模型调用与算力。

8.7 SMOPD 的扩展性仍待验证

SMOPD 的实验都只有两个 reward dimension。若扩展到 \(K\) 个目标,Stage 1 通常需要多个 specialized teacher,Stage 2 的每个 student token 又需要冻结教师前向计算;训练成本、教师存储和 top-\(\kappa\) 通信会随教师数增加。priority profile 仍是手工设置,且实验未给出与单阶段 baseline 严格等算力的比较。工具调用的 in-domain test 只有 80 个 prompt,API-Bank 主结果还对 exact-match failure 使用 LLM judge。因此,论文很好地证明了“reward density imbalance 确实存在”,但多目标规模化、评估器偏差和计算收益比仍需独立验证。

9. 未来最值得跟踪的方向

9.1 可学习而非手工设定的 trust region

当前 DPPO、BandPO、CPPO、RIPO 主要设计更合理的阈值或几何,但阈值仍是超参数。下一步可能根据模型置信度、token 位置、reward uncertainty、policy staleness 和历史崩溃信号动态分配 divergence budget。

9.2 Critic、verifier 与 world model 的融合

critic 只估计“当前 policy 下的未来回报”,verifier 判断结果,world model 预测动作后果。长程 Agent 需要三者共享状态表征但保持目标可辨识,否则 value 学习仍会被稀疏终局 reward 限制。

一个尤其值得追踪的问题是 score-to-credit calibration:如何判断 verifier 分数变化真的是当前动作造成的,而不是历史状态、评估噪声或答案泄漏。TRACE、TCPO、HCAPO 与 AgentOPSD 已经给出不同答案,但尚缺统一的、带局部反事实真值的 benchmark。

9.3 从文本轨迹到可分叉环境

BPO 展示了 sandbox snapshot 对局部 baseline 的价值。代码执行、浏览器、游戏、操作系统和机器人模拟器都可以保留中间状态;未来 Agent RL 的数据单元可能不再是一条完整 trajectory,而是“状态节点 + 多个候选 action + 可比较 continuation”。

9.4 算法与系统共同给出 scaling law

batch、rollout 并发、policy staleness、模型更新频率与 GPU placement 彼此耦合。只研究 sample efficiency 或单步吞吐都不够,真正可用的 scaling law 应直接预测在固定算力和 wall-clock 下达到目标能力的最优组合。

10. 读者应记住的要点

  • PPO 在 2026 年仍是大模型在线 RL 的底层语法;GRPO 更像是去 critic 的 PPO 分支,而不是完全不同的世界。
  • critic-free 方法适合单轮、可验证、可并行多采样的推理任务;多轮 Agent 更需要状态条件 baseline 与时间信用分配。
  • Long-horizon 的关键分界不是上下文有多长,而是环境是否在动作之间改变状态;有状态交互应优先采用 turn-level MDP。
  • dense reward 只是观测到更多分数,turn-level credit 还必须衡量每个动作带来的进展;score-to-credit conversion 是 2026 年最明确的新主线。
  • Turn-PPO、Odysseus 与 SAPO 表明 critic 在昂贵的长轨迹中重新有竞争力;GiGPO、ECPO、BEACON、TRACE 等则用局部比较或潜势函数补回 critic-free 方法缺失的状态信息。
  • 多奖励优化中,逐维标准化只能解决 reward scale,不能解决 reward density;SMOPD 表明“先获得各维能力、再用 OPD 合并”是单策略标量化之外的新路线,但目前只验证到两个 reward。
  • 固定 ratio clipping 对 LLM 长尾词表存在结构性问题,distribution-aware、probability-aware、position-aware trust region 是最密集的算法前沿。
  • 信用粒度正从 token 扩展到 segment、sequence、turn 和 branch;粒度必须与任务真实的因果结构匹配。
  • rollout 已成为算法本身:筛选、提前终止、前缀反传、状态分叉、单 rollout 和异步 correction 都会决定最终效果。
  • 评估新 PPO 变体时,必须同时看 accuracy、稳定性、entropy、tokens-to-target、time-to-target、显存和多 seed 方差。
  • 目前最稳妥的结论不是“某个新缩写已经统一取代 PPO”,而是:PPO 正在被模块化重构,未来主流会是按任务动态组合 critic、credit、correction 与 trust region 的混合系统。

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。