G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用

一句话结论:G2PO 不再把 rollout 看成彼此孤立的线,而是把相同 observation 聚成状态节点、把动作看成有向边;它先聚合多条未来结果估计节点价值,再用边两端的价值增量给动作做全局信用排序。

论文信息

  • 标题:Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning
  • 作者:Yunan Wang et al.
  • 版本:arXiv v1,2026-06-22
  • 论文arXiv:2606.22995
  • 代码github.com/Nala-YN/G2PO

1. Motivation:step-level 仍可能是“线性、局部、偶然”的

把每个 Agent turn 拆成训练样本可以缓解长上下文,但并不自动解决信用分配:

  1. 单轨迹价值高方差:同一状态之后可能因后续随机失误而失败,也可能因幸运纠错而成功。用一次终局结果给该状态定性很不可靠。
  2. 局部比较看不到绝对进展:只比较同一状态下的动作,可以找出局部更优动作,却无法区分“琐碎状态上的微小改善”和“推动任务跨过瓶颈的关键跃迁”。

多条 rollout 常会访问相同网页、物体配置或软件状态。它们天然拼成一张状态转移图,G2PO 就利用这张图共享统计证据。

2. Method 全流程

2.1 状态组图

对同一任务采样 (N) 条轨迹,把 observation 完全相同的中间步聚成状态组:

\[ G_k=\{o_j^i\mid o_j^i=\bar o_k\}. \]

状态组是节点;若动作 (a_j^i) 让 (G_s) 转到 (G_t),就创建边 ((G_s,a_j^i,G_t))。论文主实现采用完全相同 observation,不是语义近邻聚类。

2.2 聚合式状态价值

先用终局结果给每个出现位置构造折扣价值:

\[ v_j^i=\gamma^{T-j+1}R_i. \]

再对同一状态组的所有出现取平均:

\[ V(G_k)=\frac{1}{|G_k|}\sum_{o_j^i\in G_k}v_j^i. \]

这估计的是“从该 observation 出发,在当前采样分布下走向成功的平均程度”,能平均掉单条未来路径的偶然性。

2.3 三种粒度的 advantage

节点局部 advantage比较同一源节点的不同后继:

\[ A^{\mathrm{NC}}(a_j^i) =\frac{V(G_{k'})-\operatorname{mean}(\Delta_k)} {\operatorname{std}(\Delta_k)}. \]

边全局 advantage先计算一步 TD 型价值增量

\[ \delta_j^i=V(G_{k'})-V(G_k), \]

再用整张图全部边的 () 做标准化:

\[ A^{\mathrm{EC}}(a_j^i) =\frac{\delta_j^i-\operatorname{mean}(\{\delta\})} {\operatorname{std}(\{\delta\})}. \]

episode advantage仍保留终局目标:

\[ A^{\mathrm{EP}}(a_j^i) =\frac{R_i-\operatorname{mean}(\{R\})} {\operatorname{std}(\{R\})}. \]

最终:

\[ A_j^i=A^{\mathrm{EP}}(a_j^i) +w\left(A^{\mathrm{NC}}(a_j^i)+A^{\mathrm{EC}}(a_j^i)\right). \]

它同时回答三个问题:这条轨迹成功了吗?在当前节点这动作好吗?放到全图中,这次跳转有多关键?

3. 具体数值推演:一次关键跳转如何脱颖而出

下面是教学用小图。三条 rollout 的终局奖励为 ([1,0,1]),取 ()。

3.1 聚合状态价值

起始状态组 (G_1) 在三条轨迹中都出现,对应回报 ([1,0,1]):

\[ V(G_1)=\frac{1+0+1}{3}=0.667. \]

动作 (a) 转到 (G_2),该节点出现两次且两次最终都成功:

\[ V(G_2)=\frac{1+1}{2}=1. \]

动作 (b) 转到 (G_3),唯一一次最终失败:

\[ V(G_3)=0. \]

3.2 节点局部信用

从 (G_1) 出发的后继价值集合为 ([1,0]),均值 0.5、标准差 0.5:

\[ A^{\mathrm{NC}}(a)=\frac{1-0.5}{0.5}=1, \qquad A^{\mathrm{NC}}(b)=\frac{0-0.5}{0.5}=-1. \]

3.3 边全局信用

两条边的价值增量:

\[ \delta_a=1-0.667=0.333,qquad \delta_b=0-0.667=-0.667. \]

假设全图另外两条边的增量均为 0.167,则全局 () 集合近似为

\[ [0.333,-0.667,0.167,0.167], \]

均值为 0,标准差约 0.391。因此

\[ A^{\mathrm{EC}}(a)\approx0.852,qquad A^{\mathrm{EC}}(b)\approx-1.705. \]

3.4 合并三种信号

成功轨迹的 episode advantage 为

\[ A^{\mathrm{EP}}_{\mathrm{succ}} =\frac{1-0.667}{0.471}\approx0.707. \]

取 (w=0.5),关键动作 (a) 的总 advantage:

\[ A(a)=0.707+0.5(1+0.852)=1.633. \]

失败轨迹中动作 (b) 的 episode advantage 约为 (-1.414),总 advantage:

\[ A(b)=-1.414+0.5(-1-1.705)\approx-2.767. \]

图结构让动作 (a) 不只因“所在轨迹成功”获奖,还因它把状态从 0.667 推到 1.0 而获得额外全局信用。

4. 实验结果

主实验使用 Qwen2.5-1.5B/7B,group size 为 8,并在 WebShop、ALFWorld、AppWorld 上评测。

  • 1.5B ALFWorld:GRPO 总成功率 (72.8%),G2PO 为 (95.0%),提高 22.2 个百分点。
  • 1.5B WebShop:成功率从 (56.8%) 提至 (71.2%),score 从 75.8 提至 85.1。
  • 7B ALFWorld:GRPO (77.6%),G2PO (96.9%)。
  • 7B WebShop:GRPO 成功率 (66.1%),G2PO (78.3%)。
  • AppWorld,Qwen2.5-14B:G2PO 高于论文复现的其他 RL 基线,说明方法不只适用于文本家庭/购物环境。
  • 效率:优势估计约多 1 秒,仅占训练 step 的 0.4%;图计算在 CPU 完成。训练后的 Agent 也用更少环境交互步完成任务。

这些数字来自论文表 1–2,且是相对同文实现的基线;不同论文间的训练预算和任务版本不应直接横比。

5. 最具创新的点

G2PO 最具创新的地方是把信用参照系从局部 action group 扩展到整张状态图。状态聚合解决“同一状态被未来偶然性污染”,全局标准化的 TD 边增益解决“局部最优不等于全局关键”。这比单纯把轨迹拆成 step 更进一步。

6. 不足与可能改进

6.1 完全相同 observation 过于严格

网页含时间戳、排序或无关文本变化时,语义相同状态也无法合并;但模糊聚类又可能错误合并不同状态。可使用任务相关 canonicalization、结构化状态字段和带不确定性的软聚类。

6.2 observation 不一定是充分状态

相同页面文本背后可能有不同购物车、隐藏环境变量或历史依赖。此时聚合会产生 state aliasing。应加入环境 checkpoint ID、隐藏状态审计,或至少对“同 observation 不同未来”的方差做报告。

6.3 图只来自当前有限 rollout

低覆盖区域的节点价值仍然高方差;成功节点被访问次数少时,均值可能很脆弱。可加入贝叶斯平滑、置信区间或跨迭代 replay,但后者又带来 off-policy 偏差。

6.4 全局标准化受任务图构成影响

极端边会改变全图均值和方差,不同任务长度也会贡献不同数量的边。可尝试 robust normalization、按任务分层或按边访问次数加权。

6.5 因果解释有限

(V(G’)-V(G)) 是采样图上的价值差,不证明动作本身导致该差异。更严格的验证需要从同一可恢复状态执行替代动作,并保持后续策略与随机性协议一致。

7. 阅读结论

G2PO 适合“多条 rollout 会重复访问可识别环境状态”的长程 Agent。它把重复访问从冗余数据变成共享统计证据;若环境状态几乎从不重复或 observation 严重不充分,其核心优势会明显减弱。

参考入口

  • 状态图与聚合价值:第 4.1–4.2 节,式 (2)–(3)
  • 三粒度 advantage:第 4.3 节,式 (4)–(9)
  • 实验:第 5 节,表 1–2、图 4–5

G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
https://kissshhot.github.io/2026/08/20/g2po-group-graph-policy/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。