RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化

把数学题上的 RL 训练流程接到交互环境上,Agent 就会越来越会规划吗?RAGEN 的实验给出了一个不那么乐观的答案:模型可能先涨分,随后反复使用几套被奖励过的推理模板,探索减少,梯度出现尖峰,最终性能崩溃。即使没有崩溃,输出里存在 <think> 也不代表模型正在准确理解环境。

这篇论文的价值,是将多轮 Agent RL 的训练闭环、采样设计与失败诊断放在一起研究:不仅问“学会了没有”,还问“哪些经验值得学习,以及学到的推理是否真的有用”。

本文精读 RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning(Zihan Wang 等),依据 arXiv v2(2025-05-26)正文、附录与原始图表整理。本文讨论的是这篇原始 RAGEN 论文,不是后续的 RAGEN-2;数值示例为教学构造,独立判断会明确标注。

1. 一句话结论与论文全景

多轮 Agent RL 的有效训练,需要同时控制轨迹质量、更新稳定性和反馈粒度;只把成功奖励广播给完整推理轨迹,并不能保证形成可靠的长程推理。

先区分三个名字:

名称 是什么 主要作用
StarPO State-Thinking-Actions-Reward Policy Optimization,轨迹级训练框架 把状态、思考、动作和奖励组织成完整交互轨迹,可接 PPO 或 GRPO
RAGEN 实现 StarPO 的系统与实验平台 完成环境交互、轨迹采样、奖励计算和训练评测
StarPO-S 稳定化训练方案 利用奖励变化程度筛选初始状态,结合 critic 与梯度稳定化策略

StarPO 不是另一个必须替代 PPO/GRPO 的独立优化器。它首先规定多轮交互如何成为训练材料,再选择具体策略优化算法。

论文的三个核心发现是:出现一种被称为 Echo Trap 的重复策略与训练退化现象;初始状态多样性、每轮动作数量和 rollout 新鲜度影响泛化;显式推理在部分任务上有用,但在多轮任务中会缩短、变浅,甚至与环境事实不符。(§1、§4)

2. Motivation:多轮交互比单轮答案多了什么困难?

2.1 一个动作会改变以后看到的数据

单轮数学题中,题目通常固定,模型直接生成答案。多轮环境中,当前动作会改变下一次观察:箱子被推入角落后可能再也拉不出来;冰面上的移动可能滑向侧面;网页搜索的关键词会决定后续看到哪些商品。

因此训练数据不只是“问题—回答”,而是由当前策略和环境共同生成的轨迹。模型既要跨轮保留信息,也要根据反馈修正计划,不能将每一轮当成完全独立的问题。(§2.1)

2.2 自己生成、自己学习,可能放大捷径

如果某套模板偶然获得奖励,策略会更频繁地产生它,下一轮训练又更容易遇到同类样本。若奖励不能区分真实推理与碰巧成功,这个循环可能进一步强化浅层策略。

作者把重复使用局部获奖模式、探索与行为多样性减少的失败现象称为 Echo Trap。它是一种经验诊断,不是对所有自生成数据训练必然崩溃的定理,也不等同于持续学习中的“忘记旧任务”。

2.3 为什么先用小型可控环境?

复杂网页任务混有大量预训练知识和工程配置,不容易分离原因。RAGEN 因而组合了三种符号环境与 WebShop:

环境 主要难点 反馈特点
双臂 Bandit 在符号语义与收益分布之间建立对应 单轮,奖励随机
Sokoban 推箱子、避免不可逆死路 多轮,确定性转移
FrozenLake 导航并适应随机滑动 多轮,随机转移,成功奖励稀疏
WebShop 理解需求、搜索和选择商品 多轮,语言与界面交互

Bandit 本身不是长程任务;它在论文中承担较简单的对照作用。其低风险臂固定获得 0.15,高风险臂奖励为 Bernoulli(0.25),后者期望收益 0.25 更高,却有 75% 概率单次得到 0。不能仅凭一轮没有中奖判断策略不好。(附录 C.1)

3. Method:完整轨迹怎样进入 PPO 或 GRPO?

3.1 StarPO 的训练闭环

每轮模型看到状态与历史,产生思考及可执行动作:

1
2
<think>根据当前观察分析下一步……</think>
<answer>一个或多个可执行动作</answer>

环境执行动作后返回新状态和奖励。完整轨迹可记为:

\[ \tau=(s_0,a_0^T,r_0,s_1,a_1^T,r_1,\ldots,s_K), \]

其中 \(a_t^T\) 包含模型生成的思考与动作文本。目标是最大化整条轨迹的累计奖励:

\[ J(\theta)=\mathbb E_{\mathcal M,\tau\sim\pi_\theta}[R(\tau)]. \]

实际循环为:采样多个初始状态 → 每个状态生成多条交互轨迹 → 计算奖励 → 估计优势 → 更新策略 → 再采样。(§2.2–§2.3)

环境反馈虽然是轨迹上下文的一部分,却不是 Agent 选择的动作。组织整条轨迹,不等于将环境 observation 的 token 当作模型行动来强化。 具体实现需要核对生成 token 的掩码;论文在附录 D 另行比较 response masking 和 bi-level GAE,不应把所有实验都写成已经统一使用这些增强项。

3.2 两种优势估计:轨迹比较与 critic

GRPO 对同一初始状态的多条轨迹做结果比较。若一组有 \(N\) 条轨迹,奖励为 \(R_i\),则:

\[ \widehat A_i=\frac{R_i-\overline R}{\sigma_R}. \]

该轨迹中参与策略优化的 token 共享同一个结果优势。这很简洁,但不知道究竟哪轮思考或动作导致成功。实际计算还需要处理零方差和数值稳定项。(式 5–6)

PPO 则可以训练 critic,估计 token 级 value,再用 Generalized Advantage Estimation(GAE,广义优势估计)形成不同位置的优势。critic 可能平滑训练信号,但自身也可能在随机环境中难以学准,不能假设“有 critic 就一定更稳”。(§2.2.3、附录 I)

两者都可使用概率比与裁剪目标。令 \(j\) 表示某个生成 token,避免与环境轮次混淆:

\[ \rho_j=\frac{\pi_\theta(x_j\mid x_{<j})} {\pi_{\mathrm{old}}(x_j\mid x_{<j})}, \]

\[ f_j=\min\left(\rho_j A_j, \operatorname{clip}(\rho_j,1-\epsilon_{\mathrm{low}},1+\epsilon_{\mathrm{high}})A_j\right). \]

优化时最大化有效 token 上的代理目标,并按配置加入熵奖励等项。它是 token 级概率比,不是把完整多轮轨迹的所有概率相乘后只裁剪一次。

3.3 StarPO-S:筛选还有学习空间的初始状态

作者为同一初始状态定义结果不确定性:

\[ U(s_0)=\operatorname{Std}_{\tau\sim\pi_\theta(\cdot\mid s_0)}[R(\tau)]. \]

每次采样后,按组内奖励标准差对初始状态排序,仅保留最高的 \(p\%\) 状态组用于更新。这里筛的是状态组及其轨迹,不是只保留成功轨迹,也不是挑选每条轨迹中的高方差 token。(§4.2)

直觉是:全会或全不会的状态暂时缺少结果对比;有时成功、有时失败的状态可能更值得学。论文默认保留 25%,同时明确指出这么激进的比例不一定适合所有任务。

不过奖励标准差并不能自动分离策略差异和环境随机性。这个限制在 FrozenLake、Bandit 尤其重要,后文会进一步分析。

3.4 梯度稳定化:放宽上界,不是取消约束

StarPO-S 还研究了两项从已有 RL 方法借鉴的策略:(附录 D)

  • 去掉 KL 惩罚项:减少对初始参考策略的约束,仍保留策略目标与熵奖励;不是删除所有训练约束。
  • Clip-Higher:将裁剪范围改为下界 \(1-0.2=0.8\)、上界 \(1+0.28=1.28\),相对对称的上界 1.2,允许更多正优势更新。

critic、状态组过滤与梯度整形解决的是不同问题。论文展示它们可以缓解崩溃,而不是证明某个组合在任何随机环境都最优。

4. 数值例子:一次两轮交互如何变成训练信号?

以下是教学用简化示例。用一个微型冰湖展示完整链路,网格、四组采样和 critic 数值都是构造值,不是论文实际训练样本。

4.1 从状态到真实环境反馈

设网格为:

1
2
S F
H G

S 是起点,F 是安全冰面,H 是洞,G 是目标。Agent 从左上角出发:

环境轮次 模型的思考与动作 本次实际观察 奖励
0 先向右到安全冰面,避免向下进入洞;执行 Right 本次确实移动到右上角 0
1 目标在正下方;执行 Down 本次确实进入右下角目标 1

轨迹回报 \(R=0+1=1\)。但 FrozenLake 中执行意图与实际运动可能不同:论文环境中沿意图方向概率为 \(1/3\),向两个垂直方向偏移的总概率为 \(2/3\)。这条成功轨迹只是可能结果之一;若第一步滑动,Agent 应读取新观察再决定第二步,不能继续把原计划当作真实状态。

4.2 四个初始状态组,保留哪一个?

假设共采样四个初始状态,每个状态各运行四条轨迹,使用仅成功为 1 的回报:

状态组 四条回报 均值 总体标准差
A \((1,1,1,1)\) 1 0
B \((0,0,0,0)\) 0 0
C \((1,0,1,0)\) 0.5 0.5
D \((1,0,0,0)\) 0.25 0.4330

例如 C 组:

\[ U_C=\sqrt{\frac{(1-0.5)^2+(0-0.5)^2+(1-0.5)^2+(0-0.5)^2}{4}}=0.5. \]

若保留最高 25%,选中 C 组,其中成功和失败轨迹都会保留。它不是“成功数据筛选”。本例使用总体标准差便于手算;复现时应核对具体实现的标准差约定。

如果 C 组的差异完全来自滑动随机性,而不是 Agent 做了不同选择,那么这个指标也会很高。这正说明 \(U\) 是结果变化程度,不是纯粹的知识不确定性。

4.3 GRPO 与 PPO-GAE 分别给出什么优势?

对 C 组,GRPO 得到:

\[ \widehat A=(1,-1,1,-1). \]

成功轨迹的有效生成 token 获得正优势,失败轨迹获得负优势;它仍然不能区分失败是错误计划还是随机滑动。

再看带 critic 的方案。为了手算,这里把真实 token 级计算缩成两个环境步,设刚才成功轨迹的 value 为:

\[ V(s_0)=0.4,\quad V(s_1)=0.6,\quad V(s_2)=0. \]

终点为终止状态,取论文所用 \(\gamma=\lambda=1\)。TD 残差与 GAE 为:

\[ \begin{aligned} \delta_0&=0+0.6-0.4=0.2,\\ \delta_1&=1+0-0.6=0.4. \end{aligned} \]

\[ A_1=0.4,\qquad A_0=\delta_0+\gamma\lambda A_1=0.6. \]

两步的优势不再完全一样。这只是解释 critic 与累计未来反馈如何配合,不是完整复现论文的 token 级 GAE 或附录中的 bi-level GAE。

4.4 Clip-Higher 怎样改变一次更新?

选一个参与优化的 token,设旧概率为 0.20,新概率为 0.28,因此 \(\rho=1.4\);取优势 \(A=0.6\)

对称裁剪上界 1.2 时:

\[ f_{\mathrm{sym}}=\min(1.4\times0.6,1.2\times0.6)=0.72. \]

Clip-Higher 的上界 1.28 时:

\[ f_{\mathrm{high}}=\min(1.4\times0.6,1.28\times0.6)=0.768. \]

两者都已到达各自的正优势裁剪平台,不能说此处仍有继续推高概率的梯度。真正的差别在 \(1.2<\rho<1.28\) 区间:普通 PPO 已经裁剪,Clip-Higher 仍允许正优势推动概率上升。

对于负优势 \(A=-0.4\)、概率比 \(\rho=0.6\),下界仍为 0.8:

\[ f=\min(0.6\times(-0.4),0.8\times(-0.4))=-0.32. \]

所以 Clip-Higher 不是把所有方向都同等放宽。本例省略熵项、batch 平均和网络梯度传播,只计算一个有效 token 对策略代理目标的贡献。

5. Results:论文实验证明了什么?

5.1 先交代模型与交互预算

主文使用 Qwen2.5-Instruct 0.5B 研究三个符号任务,WebShop 使用 3B。典型设置每次取 8 个初始状态、每状态 16 条 rollout,最多 5 轮、总计 10 个动作;附录还给出每轮最多 5 个动作、更新 batch size 32。主实验运行约 100–200 次 rollout–update 循环。(§3、附录 C)

评测使用每环境 256 个固定初始实例,温度 0.5。这里的 Long Horizon 是多轮状态反馈与跨轮决策,不是已经验证上百轮开放世界任务;“self-evolution”也不是模型自动修改自身代码。

环境奖励并不全部是二值成功:Sokoban 包含箱子位置、完成奖励和动作成本;格式不合法还有 -0.1 惩罚。Bandit 的 success rate 指选中高期望收益臂,不是一次随机开奖得到 1 的概率,因而可以出现 100% 的策略成功率。(附录 C.1–C.3)

5.2 Echo Trap:不要只盯平均奖励

论文同时记录平均回报、组内奖励标准差、输出熵、回答长度和梯度范数。FrozenLake-PPO 的一条曲线中,标准差约在第 40 步下降,而平均奖励约到第 90 步才崩溃;这提示只看涨分可能漏掉早期风险。(§4.1、图 4)

但低方差也可能是已经稳定解决任务,熵下降也可能是有效收敛。作者的证据是这些量与模板重复、后续性能变化共同出现,不能把某个指标单独阈值化成普适崩溃判据

优化器表现也有反例:PPO 在 Bandit、Sokoban 较稳,FrozenLake 却是 GRPO 更稳。作者将后者与随机转移导致 critic 难学联系起来,这是合理解释,但不是所有随机环境中 PPO 必然失败的定理。

5.3 StarPO-S 延缓崩溃,不等于永久解决崩溃

§4.2 报告 FrozenLake 的 PPO 过滤实验:保留 75% 时,稳定阶段从约 100 步延长到 140 步;保留 50% 时,在所观察训练窗口内没有出现同样的崩溃。默认 25% 是论文选用的配置,不是所有任务都验证最优的比例。

图 6 与附录 E 显示,过滤与稳定化对低变化、易陷入重复策略的符号任务更有帮助;WebShop 原本表现和结果多样性较高,过滤的额外收益较小。本文不为没有精确数值表的训练曲线补造终点小数。

5.4 初始状态多样性:每题多采样,但不能只采同一题

固定总 rollout 预算后,减少每个初始状态的响应数,可以覆盖更多不同状态。表 1 的部分结果为:

每状态响应数 SingleSokoban SokobanNewVocab FrozenLake
32 21.09% 20.22% 17.97%
16 20.31% 21.48% 19.53%
4 20.70% 25.39% 21.48%
1 19.53% 22.27% 12.50%

从 16 降到 4,SokobanNewVocab 提高 3.91 个百分点,FrozenLake 提高 1.95;但每状态只采一次又明显损害部分泛化。它支持的是覆盖更多状态,同时保留组内比较,不是“每题采样越少越好”。SingleSokoban 的最高表值也不是 4 次配置。

5.5 每轮动作数量:中等预算较好,但不同任务最优点不同

表 2 改变每轮最多执行动作数:

每轮动作上限 Sokoban SokobanNewVocab LargeSokoban FrozenLake
1 12.11% 13.67% 1.17% 11.72%
4 26.95% 26.95% 5.08% 20.70%
5 28.13% 25.78% 6.25% 21.09%
6 33.59% 31.64% 6.64% 18.36%
7 22.27% 28.52% 3.91% 19.53%

Sokoban 从 1 到 6 个动作提高 21.48 个百分点,但 6 到 7 又下降 11.32。FrozenLake 的最高表值在 5,而不是 6。

更多动作意味着一次观察后执行更长的动作串,可能节省交互轮次,也可能减少中途纠错机会。该消融还改变可执行动作预算,不能将全部收益单独归因于“学会更好的规划”。LargeSokoban 最好也只有 6.64%,更难规划依然是明显短板。

5.6 更频繁 rollout 与显式推理:两个不同问题

Online-\(k\) 指一批 rollout 重复用于 \(k\) 次策略更新。图 7 中 Online-1 比 Online-5/10 更快收敛、泛化更好,支持及时刷新行为数据的重要性;但更频繁采样也有成本,不能只按更新步数宣布计算效率更高。

推理消融则呈现更复杂的结论:(表 3)

训练来源与评测 有推理 StarPO-S NoThink 有推理的百分点差
Bandit → Bandit 100.00 81.25 +18.75
Bandit → Bandit-Rev 67.58 56.25 +11.33
Sokoban → FrozenLake 19.92 19.53 +0.39
Sokoban → LargeSokoban 2.34 2.73 -0.39
Sokoban → Sokoban 21.48 20.73 +0.75
Sokoban → SokobanNewVocab 18.75 26.17 -7.42

单轮 Bandit 中推理有明显收益,多轮 Sokoban 的收益不稳定。表 4 的原始 Sokoban 推理长度指标从 307.1 tokens 降到第 200 步的 89.5;长度下降是现象,不能单独证明推理能力下降,还要结合行为和案例判断。

附录 L 展示了与状态不符的思考仍获得奖励的案例。因此论文提出需要更细粒度、理解推理质量的奖励,但并没有在这篇工作中完整解决如何构造可靠过程奖励。格式惩罚只能鼓励标签结构,不能验证思考内容。

6. 最具创新性的点:把训练退化与数据闭环一起诊断

我认为最有价值的贡献,是围绕完整交互轨迹,系统连接“采样分布—奖励变化—策略更新—推理退化”,并用可控环境检验这些关系。

PPO、GRPO、GAE、熵奖励与非对称裁剪都不是 RAGEN 首创。新意不应被概括为重新发明这些优化器,而是统一多轮训练抽象,刻画 Echo Trap,并提出按状态组结果变化筛选数据的稳定化方案。

最直接的支持来自过滤比例实验、梯度整形消融、rollout 多样性与新鲜度比较,以及有无推理的对照。它们也共同提醒:训练奖励上涨,不代表模型学到了更真实、更可泛化的思考。

7. 不足与可能的改进

7.1 作者明确承认的局限

§6 明确列出:任务规模较小;没有系统纳入 replay buffer 等已有 RL 实践;没有多模态任务。虽然框架描述允许重放数据,但不能因此声称本文已经实证解决了经验回放的稳定训练问题。

作者还承认激进过滤比例不一定普适,并把细粒度推理奖励作为未来方向。

7.2 我的分析:高回报方差可能只是高环境噪声

Bandit 中,即使策略永远选择最优高风险臂,奖励仍为 Bernoulli(0.25),其标准差是:

\[ \sqrt{0.25(1-0.25)}\approx0.4330. \]

所以高 \(U\) 不一定意味着还没学会,也不一定意味着行为多样。改进可以固定或配对环境随机种子,分别重复策略采样与环境采样,以区分两种变化来源。代价是额外 rollout;应比较相同采样预算下的筛选效率和下游成功率,而不只看所选样本标准差。

7.3 我的分析:全错样本可能被长期排除

完全不会的难题常常回报全零,从过滤角度看与“全会的简单题”一样缺少变化。如果一直排除,模型也失去突破难题的机会。

可以保留少量探索配额,结合难度课程或失败类型覆盖。代价是短期训练信号更稀疏;应测难题首次成功时间、不同难度覆盖率和长期表现。固定 top-25% 不应成为无需验证的默认答案。

7.4 我的分析:需要验证推理,而不只是保护推理长度

增加长度奖励可能只产生冗长模板。更有针对性的改进是检查推理中的状态事实、动作可执行性与预测后果,再比较替换或删除思考是否真的改变决策。

代价是环境特定检查器和可能被利用的代理奖励;需要同时报告事实一致性、动作成功率和长跨度泛化。过程指标提高但任务成功不变,也不能直接视为有效推理形成。

7.5 我的分析:公平比较还需要统一计算预算

过滤减少更新样本,但在计算方差前已经生成了多条 rollout;高频采样和更长动作串也改变环境交互成本。固定更新步数不等于固定计算量。

改进应同时报告环境步数、生成 token、GPU-hours、有效更新 token 和多 seed 区间,并在相同预算下比较。代价是更完整的实验记录;它可以区分“训练曲线更快”与“端到端更省资源”。

7.6 代码版本:原始 RAGEN 不等于 RAGEN-2

论文链接的官方仓库目前已经包含后续 RAGEN-2 内容、更多环境和新诊断。原始论文的 arXiv v2,只是这篇 2025 年论文的第二个版本,不是 RAGEN-2 论文

复现本文时应固定与原始实验对应的提交和配置,核对环境随机性、奖励、token mask、PPO/GRPO 分支、critic、KL、裁剪范围与 rollout 重用次数;不要把当前仓库的新方法或结果直接归到这篇论文中。

8. 读者应记住的要点

  • StarPO 是多轮轨迹级训练抽象,RAGEN 是系统,StarPO-S 是稳定化配方。
  • 筛选对象是同初始状态的轨迹组;奖励标准差提供线索,但混合了行为差异与环境噪声。
  • 多样初始状态、适中动作粒度和及时刷新 rollout 有助于训练,最优配置依赖任务与预算。
  • <think>、回答变长、奖励上涨,都不能单独证明形成了可靠长程推理。

原始资料与站内延伸

  1. 论文版本记录v2 PDFHTML 全文。方法见 §2、§4.2,主消融见表 1–4,细节见附录 C–E、I、L。
  2. RAGEN 项目主页官方代码仓库

相关博客:Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子 将多轮训练放回 Long Horizon 研究脉络;PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 讨论规划知识与规划模式的形成;OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合? 展示另一种结果反馈与密集训练信号结合方式,同时也保留了结果正确性不等于过程正确性的限制。


RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
https://kissshhot.github.io/2026/09/10/ragen-multi-turn-rl-starpo-echo-trap/
作者
丁一帆
发布于
2026年9月10日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。