TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索
一句话结论:TRIAGE 保留 GRPO 的终局方向,但让结构化 LLM judge 判断每个环境动作究竟是决定性进展、有用探索、无进展基础动作还是倒退,再用固定、有界的角色常数修正 segment advantage。
论文信息
- 标题:TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
- 作者:Xu et al.
- 版本:arXiv:2606.32017,2026
- 论文:arXiv:2606.32017
- 定位:segment-level credit、semantic role、LLM judge、agentic RL
1. Motivation:outcome 只有一条轴,Agent 动作却有不同作用
成功/失败可以决定整条轨迹总体该强化还是抑制,却无法处理两个冲突格:
- 失败轨迹中的有用探索:正确的搜索、读测试或打开容器并未立即完成任务,却改善了信息状态,不应被完全惩罚。
- 成功轨迹中的倒退:重复点击、错误编辑或绕路可能被后续动作补救,不应因最终成功而得到正信用。
普通 scalar process reward 只回答“这一步好不好”,仍可能混淆探索与无进展。TRIAGE 主张 Agent 信用需要第二条语义角色轴。
2. 四类角色
对轨迹 (i) 的第 (k) 个环境 segment,角色变量为
\[ \rho_{i,k}\in\{D,E,N,R\}. \]
- D — decisive progress:直接改变可由 verifier 检查的任务状态,如提交正确答案、购买正确商品。
- E — useful exploration:改善信息状态但尚未完成子目标,如第一次合理搜索、阅读失败测试。
- N — no-progress infrastructure:既未推进任务也未增加信息的无害基础动作。
- R — regression:破坏任务状态,或在信息已知后重复检查、点击而没有新信息。
训练时 judge 只看当前 segment 前后最多各五个 action–observation pair,不看最终 verifier outcome;评测时完全不用 judge。
3. 方法与理论
3.1 角色条件修正
若轨迹级 GRPO advantage 为 (A_i^{}),TRIAGE 定义
\[ A_{i,k}^{\mathrm{TRIAGE}} =A_i^{\mathrm{GRPO}}+\lambda c_{\hat\rho_{i,k}}. \]
固定角色常数为
\[ (c_D,c_E,c_N,c_R)=(1,0.5,-0.1,-0.5). \]
Search-QA 默认 (),ALFWorld 与 WebShop 默认 ()。合并后的 segment advantage 在 batch 内白化:
\[ \widetilde A_{i,k}^{\mathrm{TRIAGE}} =\frac{A_{i,k}^{\mathrm{TRIAGE}}-\mu_B}{\sigma_B+\epsilon}, \]
再广播到这个环境动作对应的生成 token,prompt 和 observation token 不参与 loss。
3.2 为什么角色标签理论上能帮助
设不可观测的真实 segment advantage 为 (A_{i,k}^*),GRPO 丢失的局部残差为
\[ \delta_{i,k}=A_{i,k}^*-A_i^{\mathrm{GRPO}}. \]
在所有只依赖角色 () 的修正函数中,均方误差最小的是
\[ g^*(\rho)=\mathbb E[\delta_{i,k}\mid\rho_{i,k}=\rho]. \]
论文把它解释为残差到角色变量上的 (L_2) 投影。固定修正 (c_{}) 相对 GRPO 的 MSE 变化为
\[ \Delta\mathrm{MSE} =\lambda^2\mathbb E[c_{\hat\rho}^2] -2\lambda\operatorname{Cov}(c_{\hat\rho},\delta). \]
只有当 judge 使角色常数与真实残差正相关时,足够小的 () 才会降低误差。这是有条件的论证,不是无条件保证。
4. 具体数值推演:成功轨迹里也要惩罚回退
同一任务采样四条轨迹,reward 为 ([1,1,0,0])。均值 0.5、标准差 0.5,所以成功轨迹的 GRPO advantage 为 (+1)。
假设第一条成功轨迹含四个动作,judge 依次标为
\[ [E,D,R,N]. \]
取 ALFWorld/WebShop 的 (),角色修正分别是
\[ 0.2[0.5,1,-0.5,-0.1]=[0.1,0.2,-0.1,-0.02]. \]
合并后的 advantage:
\[ A^{\mathrm{TRIAGE}}=[1.1,1.2,0.9,0.98]. \]
于是决定性进展得到 1.2,有用探索得到 1.1,倒退动作即便位于成功轨迹也只得到 0.9。白化不会改变这四者的相对顺序。
再看一条失败轨迹,GRPO advantage 为 (-1)。若其中某一步是有用探索:
\[ A_E^{\mathrm{TRIAGE}}=-1+0.2\times0.5=-0.9. \]
它仍服从失败轨迹的总体负方向,但惩罚较轻;这正是“outcome 定方向、role 调幅度”。
5. 实验结果
论文在 ALFWorld、Search-QA、WebShop 上训练 Qwen2.5-7B-Instruct 与 Qwen3-1.7B-Instruct。
- Qwen2.5-7B:ALFWorld 从 GRPO 的 (79.6%) 到 (87.5%),Search-QA 从 43.3 到 48.1,WebShop 从 (70.1%) 到 (77.2%)。
- Qwen3-1.7B:ALFWorld 从 (45.2%) 到 (56.4%),WebShop 从 (37.5%) 到 (55.9%)。
- ALFWorld 与 WebShop 报告十次独立训练/评估的均值与样本标准差;Search-QA 只有单次运行。
- 135 个人工标注 segment 的审计中,Qwen3-8B-thinking 对“成功轨迹中的 R”达到 86.1 F1;no-think 只有 29.2。
- 用 no-think judge 时,ALFWorld 和 WebShop 反而低于 GRPO,直接证明方法依赖 judge 可靠性。
- scalar process reward 虽优于 GRPO,但在三项任务均低于角色化 TRIAGE。
- 去掉 regression penalty 的损失大于去掉 exploration bonus;完整方法还将 ALFWorld/WebShop 成功轨迹长度缩短 10.4%/14.8%。
6. 最具创新的点
TRIAGE 的创新不是让 judge 输出更复杂的连续分数,而是主动降低 judge 的自由度:先做可审计的离散角色分类,再用固定规则映射信用。它明确指出“探索不是小幅进展,而是信息状态上的另一类进展”,这非常契合部分可观测 Agent。
7. 不足与可能改进
7.1 judge 失误会直接反向伤害训练
论文自己的 no-think 结果已经展示这一点。应使用校准集、角色置信度、双 judge 一致性与低置信回退;也可将硬角色换成概率分布 ((p_D,p_E,p_N,p_R))。
7.2 角色常数仍是人工先验
固定 ((1,0.5,-0.1,-0.5)) 易解释,但不同任务的角色真实边际贡献未必同序等距。可以在不接触 test set 的校准环境里学习单调、有界的角色权重,并报告灵敏度。
7.3 角色不是因果贡献
“看起来是决定性进展”不等于该动作在 counterfactual 下必要。可在可 checkpoint 环境中对 D/R 动作做替代重放,校准角色与实际 return difference。
7.4 训练成本明显
每个 segment 一次 judge 调用增加 wall-clock;缓存只能解决重复训练,不能消除首次标注成本。可只审查成功轨迹中的可疑重复和失败轨迹中的探索候选。
7.5 分类边界会随能力提升而变化
强 Agent 中明显循环变少,问题会转向“同为 D 的动作推进多少”。未来需要层级角色:先判断类型,再在类型内估计强度。
8. 阅读结论
TRIAGE 给 agentic credit assignment 增加了一个很实用的语义坐标系。它特别适合动作类型异质、探索不可避免、成功轨迹也常含冗余恢复的任务;但收益不是白送的,可靠 judge 是方法成立的核心前提。
参考入口
- 角色定义:第 3 节,表 1–2
- 训练规则与理论:第 4 节,式 (2)–(8)
- 主实验与 judge 审计:第 5 节,表 3–6
- 角色常数敏感性与案例:附录 F–H
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。