2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题

写在前面

当 Agent 要连续搜索几十轮、修改代码、读报错、管理记忆,甚至跨多个环境工作时,人们常把失败统一归因于“奖励太稀疏”。这只说对了一部分。

Long-horizon Agentic RL 与细粒度奖励其实是两个不同问题:

  • Long horizon 问的是:怎样让 Agent 在很长、部分可观测、可能中途失败的轨迹中,仍能探索到成功、维持任务状态、执行分层计划并恢复错误;
  • 细粒度奖励与信用分配问的是:已知一条轨迹的结果后,怎样判断其中哪个 turn、step、branch、observation 或 memory operation 应获得多少信用。

二者确实相互影响:horizon 越长,终局奖励越难归因;但更密的奖励并不能自动解决目标遗忘、上下文溢出、计划漂移、失败恢复、异步训练和成功轨迹不可达。

本文的核心判断是:Long-horizon 的首要目标是降低有效决策长度并维持可恢复的任务状态;细粒度奖励的目标则是提供可信、守恒、与动作粒度匹配的局部证据。二者在训练中相交,但不能互相替代。

本文截至 2026 年 9 月 2 日,先独立梳理两条研究主线,再分析它们的交叉区域。正式会议论文与 2026 年预印本会明确区分。

1. 先把两个问题分开

Agentic RL 的轨迹可以写成:

\[ \tau=(o_0,a_0,o_1,a_1,\ldots,o_T,a_T), \]

其中 \(o_t\) 是网页、终端、GUI、数据库或其他 Agent 返回的 observation,\(a_t\) 是思考、工具调用、文件操作、记忆操作或委托动作。策略目标是:

\[ J(\theta)=\mathbb E_{\tau\sim\pi_\theta,P} \left[\sum_{t=0}^{T}\gamma^t r_t\right]. \]

与单轮 RLVR 不同,外部环境会在每次动作后改变,Agent 通常还看不到完整真实状态,因此它面对的是长时程 POMDP,而不是一次完整生成。

1.1 成功轨迹会指数级变稀

做一个极简估算:若每个关键决策独立正确的概率为 \(p=0.9\),连续 10 个决策都正确的概率仍有

\[ 0.9^{10}\approx 34.9\%, \]

但 50 个决策后只剩

\[ 0.9^{50}\approx 0.52\%. \]

这也是为什么弱模型在长任务中经常出现“整个 rollout group 全部失败”:不是优化器没有梯度,而是策略根本到不了奖励可达区。Horizon Length 实证研究在受控任务中把探索难度与其他变量拆开,发现仅增加 horizon 就会同时恶化探索和信用分配;先在短 horizon 上学习,再迁移到长 horizon,反而更稳定,并出现 horizon generalization。

1.2 细粒度奖励解决的是归因,不是 horizon 本身

GRPO 常把一条轨迹的相对终局优势

\[ \hat A_i= \frac{R_i-\operatorname{mean}(R_1,\ldots,R_G)} {\operatorname{std}(R_1,\ldots,R_G)+\epsilon} \]

广播到该轨迹的全部 token。对短答案这很实用;对 50 轮搜索,它会产生四类系统误差:

  1. 奖励成功轨迹里的重复搜索和偶然正确;
  2. 惩罚失败轨迹中有价值的早期探索;
  3. 无法确定“哪一步改变了后续状态”;
  4. 轨迹越长,真正关键动作在总梯度中的占比越小。

一篇覆盖 47 种方法的长程信用分配综述因此把问题按 token、segment、step、turn、trajectory 和 multi-agent 等粒度,以及 Monte Carlo、TD、模型式、博弈论和信息论等方法重新组织。这个分类解释的是 credit assignment,而不是 long horizon 的全部问题。

1.3 两者的边界

把奖励做密只解决了“梯度稀疏”,没有解决“局部判断是否可信”。一个过程奖励模型可能偏爱冗长解释;一个网页反馈可能被 prompt injection 污染;一个弱搜索器可能把正确动作判错。最值得记住的原则是:

稀疏但正确的奖励,往往好过稠密但系统性错误的奖励。

VPR给出了非常直接的证据:在可用强规则验证每一步时,稠密 turn 奖励显著有效;当 MCTS 验证器太弱时,加入过程奖励甚至会低于基础策略。

一个简单判据是:

  • 如果方法主要改变 reward、advantage 或 credit 的分配,它属于细粒度奖励;
  • 如果方法主要改变子目标、技能层级、工作记忆、上下文压缩、失败恢复、课程、异步 rollout 或长程评估,它属于 long horizon;
  • 如果同时把长轨迹切成 milestone,并为每段构造局部 return,它位于两者交叉区域。

2. 第一条主线:Long-Horizon Agentic RL

Long horizon 的本质不是“上下文里出现了很多 token”,而是当前动作会通过很长的因果链影响遥远结果。一个模型可能拥有百万 token context,却仍不断重复失败动作;另一个 Agent 只保留紧凑状态摘要,却能稳定执行数百轮。

因此:

Long context 解决“历史能不能放进去”,long horizon 解决“Agent 能不能持续做对决策”。

2.1 探索可达性:先让策略到达奖励区域

若每个关键动作独立正确概率为 \(p\),连续 \(H\) 个动作全部正确的概率为 \(p^H\)。这意味着当 horizon 增长时,成功 rollout 会指数级变稀,整个 GRPO group 可能全部得到零分。

On Training Large Language Models for Long-Horizon Tasks通过受控实验把 horizon 与模型规模、任务表示等因素分开,发现长度本身就会造成探索和训练不稳定;在短 horizon 上训练后测试更长任务,能够出现 horizon generalization。它提示真正的长程训练需要:

  • horizon curriculum:先学习短任务,再逐步增加有效决策数;
  • 最小动作指导与 successful-prefix reuse;
  • 在高不确定节点分叉,而不是独立重采整条轨迹;
  • 保存环境 checkpoint,从中间状态继续探索;
  • 按失败恢复次数、工具延迟和记忆跨度设计课程。

SearchGym正是环境课程路线:先构造知识图谱与文档严格对齐的可验证搜索环境,再从基本交互逐渐训练到复杂、长程规划。InfoFlow则把目标写成 reward density optimization,通过 subgoal scaffolding、卡住时的 pathfinding hint 和双 Agent refinement,提高单位探索成本获得的有效奖励。

2.2 时间抽象:把 100 个动作压缩为几个宏观决策

如果 Agent 永远以 token 或原子工具调用为决策单位,100 轮任务就永远需要 100 次都做对。更根本的路线是层级策略:

\[ \text{Goal} \rightarrow \text{Subgoal} \rightarrow \text{Skill / Option} \rightarrow \text{Tool Action}. \]

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents提出 MiRA:推理时用 subgoal decomposition 维护动态计划,训练时用 milestone-based dense reward 和 potential critic 评价阶段进展。论文报告 Gemma3-12B 在 WebArena-Lite 上由 6.4% 提升到 43.0%;这是 2026 年预印本,结果仍需更多独立复现。

Milestone-Guided Policy Learning for Long-Horizon Language Agents提出 BEACON,把轨迹按 milestone 边界切分,在 segment 内做 temporal reward shaping,并使用局部与全局双尺度 advantage,避免遥远终局失败污染正确前缀。论文报告长程 ALFWorld 上 GRPO 为 53.5%,BEACON 为 92.9%,有效样本利用率从 23.7% 提升到 82.0%。

WebAnchor则发现长程 Web 搜索存在 plan anchor:第一步计划对后续行为影响不成比例。Anchor-GRPO 先用从 self-play 与人工校准得到的 rubric 优化初始计划,再用稀疏任务奖励训练执行,从而把“规划正确”和“执行正确”分开处理。

这些工作共同说明:最有潜力的 long-horizon 方法不是无限细化 token reward,而是降低 effective horizon。

2.3 状态与工作记忆:把历史变成可决策的 belief state

很多长程失败实际是状态丢失:早期约束被截断,尝试过的路径被遗忘,工具 observation 淹没关键证据,或者摘要删除了后续验证需要的信息。

理想状态不是完整转录,而是:

\[ b_t=f(o_{\leq t},a_{<t},m_t), \]

其中 \(b_t\) 至少保留当前目标、子目标、已满足约束、失败路径、证据来源、剩余预算和可恢复 checkpoint。

Beyond the Context Window提出 SUPO,让 Agent 周期性总结工具历史,并端到端联合优化工具行为与 summarization strategy,使训练可以跨越固定 context window。Memory as Action更进一步,把 context insertion/deletion 直接变成策略动作;MemAct-RL-14B 在作者实验中达到与大 16 倍模型相当的准确率,同时把平均上下文长度降低 51%。

PACE根据未来信息需求自适应提取历史,在 ultra-long-horizon 场景中扩展到 4,897 个 interaction step。COMPASS维护随任务进展演化的 context,而不是持续追加原始历史。AgentSwing则在多个 context-management 分支之间做 lookahead routing,论文报告最多以 3 倍更少的交互轮数达到或超过静态压缩策略。

这里最关键的研究问题不是摘要是否流畅,而是:压缩后的状态是否仍近似 Markov,能否支持价值估计、反事实恢复和后续约束验证。

2.4 计划稳定与失败恢复:错误不应直接等于轨迹结束

真实长任务一定会出错。与短任务相比,更重要的能力是检测计划失效、定位错误层级、回退到可靠状态并重新规划。

Falsifiable Commitment Planning把每个计划步骤写成 Falsifiable Commitment Unit:包含 subgoal、可复用 skill、支持证据、反驳证据和置信度。Agent 运行 plan-test-repair 循环;证据否定当前承诺时,只修改 execution、skill 或 planning 中最小必要层级。论文在 WebArena 上报告相对最强基线平均成功率提升 13.8%,且增益主要来自长任务。

面向长程 Agent,reward 也不应简单惩罚所有局部失败。一些负反馈是信息探索的必要成本。更合理的训练目标应区分:

  • 无信息重复与有信息失败;
  • 可恢复错误与不可逆错误;
  • 及时停止错误路径与过早放弃;
  • 从 checkpoint 恢复与从头重试;
  • 请求帮助与无预算继续探索。

2.5 训练系统:超长 rollout 让系统问题变成算法问题

轨迹越长,rollout 时长方差越大。同步 GRPO 会等待最慢样本,网页和代码环境又会造成大量非确定性;一条轨迹生成期间,策略可能已经更新,带来 off-policy lag。

因此 long-horizon 系统需要:

  • single-rollout actor-critic;
  • 异步 rollout 与 stale-policy correction;
  • action/turn 级资源调度;
  • environment checkpoint 与 deterministic replay;
  • trajectory truncation、continuation 和跨批次状态保存;
  • 对 observation token、外部 API 和沙箱成本单独核算。

Turn-PPOSingle-Rollout Asynchronous Optimization(SAO)ARL-Tangram一类 action-level scheduler 属于这一层。它们不一定直接改善规划,却决定百轮、千轮轨迹是否能以可接受成本进入训练闭环。

2.6 评估:必须把长度作为独立变量

如果只报告平均成功率,就无法判断收益究竟来自长程能力,还是只改善了大多数 5–10 轮样本。

Odysseys收集 200 个真实、多网站、可能持续数小时的 Web 任务,并指出 binary pass/fail 不足以评估长任务,因此为每个任务提供平均 6.1 个 graded rubric,还定义 Trajectory Efficiency。作者测试的最强模型成功率为 44.5%,但效率指标只有 1.15%。

AgencyBench把评估扩展到百万 token 真实上下文;GTA研究如何规模化生成长程 Web 任务。一个可信的 long-horizon 评估至少应报告:

  • 按 5、10、20、50、100 turn 分桶的成功率;
  • 成功率随 horizon 的下降斜率;
  • 短程训练到长程测试的 horizon generalization;
  • 中途注入错误后的检测率和恢复率;
  • 跨距离约束保留率与 memory retrieval precision;
  • 每个成功任务的 token、environment step、时间和费用;
  • 插入无关步骤后,策略与 value 是否发生异常漂移。

2.7 严格意义上的 Long-Horizon 论文地图

子问题 论文 状态 核心贡献
长度规律 Horizon Length Study 2026 预印本 控制变量研究 horizon 对探索和训练稳定性的影响
子目标 MiRA 2026 预印本 动态 subgoal planning 与 milestone reward
时间抽象 BEACON 2026 预印本 milestone 分段与双尺度 advantage
规划稳定 WebAnchor Findings ACL 2026 单独优化初始 plan anchor 与后续执行
上下文 RL SUPO ACL 2026 联合学习工具行为与历史摘要
工作记忆 MemAct Findings ACL 2026 把上下文增删建模为 RL action
上下文提取 PACE ACL 2026 支持最多数千轮的预测式历史提取
演化上下文 COMPASS ACL 2026 维护随任务演化的紧凑 context
自我修复 FCPAgent 2026 预印本 可证伪计划承诺与最小范围修复
环境课程 SearchGym ACL 2026 从简单交互到长程搜索的可验证课程
奖励可达性 InfoFlow ACL 2026 优化单位探索成本的 reward density
离线长 GUI SOLAR-RL Findings ACL 2026 从静态轨迹模拟长程在线信用
真实评估 Odysseys 2026 预印本 多站点、数小时任务与轨迹效率
百万上下文 AgencyBench ACL 2026 1M-token 真实场景的自主能力评估
任务生成 GTA ACL 2026 规模化生成长程 Web Agent 任务

这张表刻意没有把 TRACE、SOAR、VPR 等都算作“纯 long-horizon 论文”:它们能帮助长轨迹训练,但研究中心仍然是局部 reward 或 credit。

3. 第二条主线:细粒度奖励与信用分配

3.1 奖励粒度地图:究竟在奖励什么

粒度 被评价对象 常见信号源 代表方法 主要风险
trajectory / session 完整任务是否成功 单元测试、答案、环境终态 GRPO、PPO、DuCA 信号稀疏,无法定位关键动作
turn 一轮思考与工具调用 critic、答案进展、环境反馈 Turn-PPO、TIPS、TRACE turn 边界定义与长上下文估值
step / action 一个环境动作 oracle、共享状态比较、hindsight VPR、HGPO、HCAPO 局部最优不等于长期最优
branch / edge 同一状态下的替代动作 树搜索、图距离、反事实验证 SALT、GraphGPO、CSO 需要足够分支覆盖或额外 rollout
observation 动作后的环境响应 真实工具输出、反馈模式 SOAR、EFCA observation 可能不可信,且不是策略动作
token 某段生成中的 token privileged teacher、自蒸馏 ADRS、AgentOPSD 相关性被误当作因果信用
memory operation 写入、删除、检索、压缩 后续答案引用与证据来源 Fine-Mem、AgeMem 奖励延迟极长,归因跨上下文
multi-timescale 局部体验与终局目标 dense + sparse value heads DuCA 数值尺度不同导致一类信号支配另一类

一个重要区分是:reward granularity 不等于 policy action granularity。 例如 SOAR 给 observation token 辅助优势,是在学习环境后果,并不是说 observation 是 Agent 的可选动作;DuCA 同时学习 turn 和 session 回报,也不意味着两者应直接相加。

3.2 细粒度信用的六种主流范式

3.2.1 把 turn 或 step 重新定义为 MDP 动作

token-level PPO 把每个 token 都看作一步,但环境只在完整工具调用后才真正转移。工具调用内部的普通 token 转移,与调用完成后的 observation 转移是两种不同动力学。Turn-PPO因此把一整个 response 作为动作,只在每个 turn 的最后一个 token 读取 critic value,按 turn 计算 GAE,并在 response 层做 clipping。

它没有增加策略前向与反向成本,却让 critic 对齐真实环境边界。在 WebShop 上,Qwen2.5-3B 的 GRPO、token-PPO、Turn-PPO 成功率分别约为 0.72、0.73、0.75;在更长的 Sokoban 上,Qwen2.5-7B 的 token-PPO 与 Turn-PPO 分别为 2.90 和 3.74,而 GRPO 训练崩溃。论文同时提醒:critic 学习率通常需要达到 actor 的 5–10 倍,稳定性仍依赖价值网络。

StepPO从建模角度更激进:把完整 reasoning/tool step 作为 action,让过程验证器和优势估计都围绕 step MDP 对齐。两者共同说明,长时程 Agent 中最自然的优化单位通常不是 token,也不是整条 sequence,而是会引起环境状态变化的 turn。

适用条件:

  • 环境边界清楚,工具调用可以稳定分段;
  • 能承担 critic,或能提供 step return;
  • 真实交互无法为同一任务同步采样很多条 group rollout。

3.2.2 用答案进展构造势函数与 TD 信号

搜索 Agent 常有已知标准答案,但中间没有逐步标签。TIPS 与 TRACE 都利用一个关键观察:如果当前状态包含了更有用的证据,那么参考模型生成标准答案的条件概率应该上升。

TIPS定义答案势函数:

\[ \Phi(S)=\log\sum_m p_{\text{teacher}}(A^{(m)}\mid S), \]

并给第 \(k\) 个 turn 势差奖励:

\[ \Delta_k=\alpha\,[\Phi(S_k)-\Phi(S_{k-1})]. \]

\(\gamma=1\) 且终态势函数按论文条件处理时,这属于 potential-based shaping,不改变原任务的最优策略。Qwen2.5-7B 在论文聚合的多跳 QA 上,PPO 的平均 EM/F1 为 37.28/45.07,TIPS 提升到 41.71/51.24;额外 FLOPs 约 11.7%,运行时间增加约 16%–18%。

TRACE不直接对原始答案 log-likelihood 作差,而先定义“距离能回答问题还剩多少缺口”。设冻结参考模型在状态 \(S_k\) 上生成标准答案 \(y^*\) 的平均 log-likelihood 为

\[ \bar\ell_k=\frac{1}{|y^*|}\sum_t \log\pi_{\text{ref}}(y_t^*\mid S_k,y_{<t}^*), \]

剩余缺口为 \(d_k=-\bar\ell_k+\epsilon\),状态值写成

\[ V(S_k)=\log\frac{d_0}{d_k}. \]

于是一步 TD 信用为

\[ \delta_k=V(S_{k+1})-V(S_k) =\log\frac{d_k}{d_{k+1}}. \]

它为正表示本轮动作与 observation 让标准答案更容易恢复,为负则表示状态变差。更重要的是:

\[ \sum_{k=0}^{T-1}\delta_k =\log\frac{d_0}{d_T}, \]

因此仅靠插入很多无信息步骤不能凭空积累塑形奖励。在 BrowseComp-Plus 上,Qwen3-4B 的基础、GRPO、TRACE 分别为 7.2、30.0、35.6;30B-A3B 则为 8.4、36.4、42.6。

这类方法信号精细、无需人工步骤标签,但依赖可用标准答案或参考答案,最适合 deep search、可验证问答与带 gold output 的 RLVR-Agent,不适合开放式研究和主观任务。

3.2.3 在共享状态、图结构和一致历史中比较

普通 GRPO 比较同题的完整轨迹,但不同 step 的历史上下文可能完全不同。HGPO指出这种 historical context inconsistency 会污染 step-wise group comparison,因此按历史一致性建立层级分组,再自适应聚合不同层的优势;它不需要额外模型或额外 rollout,并已发表于 ICLR 2026。

SALT把同一 prompt 的多条 rollout 聚合为图。若多条轨迹经过相同的 \((state,action,next\ state)\) 边,就对它们的 trajectory advantage 求平均;未共享的边仍保留原始优势。这样只利用 outcome reward,也能让“多次出现且稳定通向成功”的局部边获得更可靠信用。ALFWorld 上,1.5B 模型由 GRPO 的 81.8 提升到 85.2,7B 由 72.5 提升到 77.8;但 WebShop 7B 的 RLOO 版本从 76.8 降到 75.2,说明状态可合并性和组内覆盖很关键。

GraphGPO进一步把 rollout 转成状态转移图,以节点到目标的距离变化构造 edge advantage,尝试解决“成功轨迹也可能包含绕路”的问题。AT²PO则把高熵节点分叉、叶子回报向祖先回传和 turn-level clipping 统一起来。

这条路线不创造新的外部奖励,而是改善“与谁比较、在哪个状态比较”。它特别适合:

  • 同题可以生成多条 rollout;
  • 状态可规范化或重复访问;
  • 树搜索可以共享前缀;
  • 不想增加 reward model 或 teacher 的额外成本。

3.2.4 用 hindsight 与训练期 privileged information 自蒸馏

如果终局成功后才能看懂早期动作的价值,可以让模型“站在结局回看过程”。

HCAPO把最终成功状态放入 hindsight prompt,用一个生成式验证器估计早期动作在已知结局条件下的合理性。其核心量是:

\[ Q^H_{i,t}=\rho_{i,t}G_{i,t},\qquad \rho_{i,t}= \frac{h(a_t\mid s_t,s_{\text{final}})} {\pi(a_t\mid s_t)}. \]

论文把宏观 GRPO advantage 与微观 hindsight \(Q\) 结合。Qwen2.5-7B 在 ALFWorld 从 GRPO 的 77.6 提升到 91.4,在 WebShop 从 66.1 提升到 73.8;代价是训练时间增加约 8.3%。

AgentOPSD只在训练时给同一个策略额外技能提示,计算有技能 teacher 与普通 student 对动作的 log-prob gap,再把证据递归更新到成功信念:

\[ e_k=\log\frac{\pi(a_k\mid s_k,c^+)} {\pi(a_k\mid s_k)},\qquad \ell_k=\operatorname{logit}(B_0)+\gamma c_{k-1}+e_k. \]

局部信用来自信念增量 \(B_k-B_{k-1}\),并与组内 outcome advantage 的方向对齐,避免局部 teacher 反转最终目标。论文报告 Qwen2.5-7B 在 ALFWorld 从 GRPO 的 81.2 提升到 89.1,WebShop 从 72.6 提升到 79.7;随额外 turn 增加的成功率下降斜率由 GRPO 的每轮 -2.91 降到 -0.54。

ADRS把 privileged teacher 信号下沉到 token,但先在 step 内中心化为零和,再用 teacher confidence 与真实 return 的协方差门控。它明确承认这种 sampled zero-sum reward 并不是固定 Markov potential,因此没有策略不变性保证。其 ALFWorld 3B 结果为 94.5,对应 GRPO 为 75.0;这是 2026 年 8 月预印本,数字需要等待更多独立复现。

这类方法的共同优点是推理时不需要额外技能或 teacher;共同风险是 privileged teacher 的偏见可能被蒸馏进策略。门控、方向对齐和有界缩放比“直接加 token reward”更重要。

3.2.5 从环境反馈与可执行验证器获得局部奖励

最可靠的细粒度信号通常不是 LLM 的主观评分,而是环境本身能验证的状态变化。

VPR使用任务特定 oracle 检查每个动作,例如约束求解器、后验计算或 MCTS,再在同一 turn 的活跃轨迹间归一化过程优势。受控推导中,若验证器与真实动作正确性的分歧率为 \(\varepsilon\),梯度偏差可由 \(G\varepsilon\) 上界控制;而稠密信号规模随 \(T\) 增长,单纯终局成功信号在需要连续正确时会像 \(Tp^T\) 一样快速消失。实测 Sudoku 成功率 VPR/终局奖励/MC 过程奖励分别为 56.25/48.44/34.73,Minesweeper 为 10.39/3.91/2.34。

EFCA不要求完整 oracle,而是从环境反馈文本中抽取短期正负信号,并从最近 \(K\) 轮连续失败或长期无正反馈中得到中期历史信号:

\[ C_t=\alpha c_t^{\text{feedback}}+\beta c_t^{\text{history}}, \]

再重加权原始 discounted return:

\[ w_t=\operatorname{clip}(1+\lambda C_t,w_{\min},w_{\max}), \qquad \widetilde R_t=w_tR_t^{\text{base}}. \]

ALFWorld 1.5B 上,EFCA 为 95.31,HGPO、GiGPO、GraphGPO 分别为 91.99、90.88、92.71;移除历史信号后降到 90.95,移除短期反馈后为 91.40。它成本低,但依赖表面反馈模式,且“暂时失败”有时正是全局探索必经步骤。

SOAR走的是 observation supervision 路线:环境 observation token 原本被 GRPO mask 掉,它给这些 token 正的辅助优势,权重由前序动作相对轨迹平均的负熵决定。Qwen3-8B 的 deep research 聚合成绩由 GRPO 的 37.4 提升到 41.2,14B 由 37.9 提升到 44.3,且不需要额外模型或前向计算。这里的准确解释是“学习动作后的世界反馈”,而不是“给环境 token 做因果动作信用”。

SOLAR-RL则针对离线 GUI 轨迹识别第一个无效动作:在失效点之前给予正信用,之后给予负信用,再把总塑形奖励对齐轨迹质量。Android Control 高难 split 的离线成功率达到 69.27,在超长任务上避免了普通 GRPO 的训练坍塌。

3.2.6 只奖励关键节点,并融合不同时间尺度

不是每个 token、每个 step 都值得精细评估。选择性信用可以同时降低噪声和成本。

STAPO用归一化熵与 IQR 找到相对同一 anchor state 的异常 step,只在这些节点计算“完整历史策略”与“遮蔽历史策略”的 KL 差异,并用 reference penalty 防止代理奖励被利用。ALFWorld 上 Qwen2.5-7B 接近 96.9,额外开销约 5.7%;在短 horizon 搜索 QA 上收益只有约 1 点,说明它更适合真正的长轨迹和可重复 anchor state。

CSO从失败轨迹中寻找专家替代动作,只对“替代分支能把失败翻成成功”的步骤建立偏好对。GAIA-Text 上,SFT 模型为 35.9,CSO 达到 49.5;PRM 过滤加结果验证只需 671 个偏好对,去掉验证后虽然得到 4,126 对,成绩反而降到 43.6。它不是纯 online RL,而是很有代表性的 verified counterfactual credit。

DuCA面对对话式推荐中的双时间尺度:turn 奖励描述当轮体验,session 奖励描述最终转化。它使用两个 value head,各自做 GAE 与归一化后再融合,而不是直接把数值尺度不同的奖励相加。实验中 CVR 由 GRPO 的 22.88% 提升到 24.44%,跨 turn 重复率从 15.29% 降到 2.71%。

Fine-Mem把同一思想用于长期记忆。它既给当前 QA chunk 稠密奖励,也按照最终答案引用的证据来源,把全局奖励守恒地回传给产生这些证据的历史 memory write:

\[ r_t=\frac{1-\beta}{T}r_{\text{global}}+\beta N_t. \]

这类 provenance-aware reward 对长期研究 Agent 很有启发:若系统能记录“最终结论引用了哪次搜索、哪条记忆和哪段代码修改”,就不必只靠语言模型猜测因果贡献。

3.3 一个五轮搜索例子:四种信用信号会怎样评价同一轨迹

下面是教学用简化例子,不是复现某篇论文的完整训练配置。

Agent 要搜索并核验一个答案,五轮行为依次是:

  1. 搜到泛泛的二手介绍;
  2. 找到官方页面;
  3. 打开包含关键数字的表格;
  4. 又访问一篇相互矛盾的博客;
  5. 回到官方来源并给出正确答案。

3.3.1 终局 GRPO:五轮获得同一个信用

如果最终答案正确,轨迹优势为 \(+1\),五轮全部被奖励。第 1 轮的冗余与第 4 轮的倒退无法被区分。

3.3.2 TRACE:用剩余答案缺口做可加和 TD

假设冻结参考模型在各状态上的答案平均 log-likelihood 对应缺口为:

\[ d=[4.1,\,3.7,\,2.1,\,2.2,\,0.9]. \]

四个状态转移的信用为:

\[ \delta_k=\log(d_k/d_{k+1}) \approx[0.102,\,0.567,\,-0.047,\,0.894]. \]

第 2、5 轮带来最大进展,第 4 轮为负;并且

\[ \sum_k\delta_k\approx1.516 =\log(4.1/0.9). \]

这说明势差既能定位贡献,又不会因为拆成更多无信息 turn 而增加总奖励。

3.3.3 EFCA:短期反馈与中期历史重加权

若环境反馈依次抽取为 \([0,+1,+1,-1,+1]\),且第 4 轮还触发“连续无有效证据”的历史惩罚,那么它的 \(C_t\) 最低,回报权重 \(w_t<1\);第 3 和第 5 轮有明确正反馈,\(w_t>1\)。这种方法不需要知道标准答案的 token 概率,但是否可靠取决于反馈模式能否表达真实进展。

3.3.4 反事实分支:直接问“换一步会怎样”

在第 4 轮状态分叉:

  • A:继续阅读冲突博客,最终失败;
  • B:回到官方表格交叉核验,最终成功。

SALT/GraphGPO 会利用共享状态或图距离比较两条边;CSO 只在验证到 B 能把失败翻转为成功后,为这一节点建立偏好。与 teacher 打分相比,受控分叉更接近因果信用,但需要额外 rollout、可重置环境和可靠终态验证。

这个例子揭示了一条实践规律:先尽量使用环境可验证的反事实,其次使用守恒的势差,再考虑 teacher 或相关性代理;信号越远离真实执行结果,门控和上限约束越重要。

3.4 细粒度奖励论文地图:证据与边界

下表只收录主要研究局部 reward、advantage 或 credit 的工作。结果来自各论文自己的实验设置,不能跨行直接横向排名。

论文 状态 粒度 / 信号源 代表结果 主要边界
Turn-PPO Findings EACL 2026 turn critic + turn GAE Sokoban 7B:2.90→3.74 需要稳定 critic
TIPS ICLR 2026 答案势函数 turn reward QA 平均 EM:37.28→41.71 需要参考答案与 teacher
HGPO ICLR 2026 历史一致的 step group 不加模型/rollout 改善 step 比较 依赖可分组上下文
SALT Findings EACL 2026 共享状态图 edge credit ALFWorld 1.5B:81.8→85.2 状态合并与 group 覆盖
HCAPO 2026 预印本 hindsight action score ALFWorld 7B:77.6→91.4 hindsight prompt 可能 OOD
STAPO ACL 2026 高熵异常 step 选择性奖励 ALFWorld 7B 约 96.9 需额外前向和 anchor
SOAR ACL 2026 observation 辅助优势 Deep research 14B:37.9→44.3 可信 observation 前提
Fine-Mem ACL 2026 证据来源到 memory write 两项记忆基准平均 0.663/0.664 依赖证据 provenance
CSO Findings ACL 2026 验证过的反事实关键 step GAIA-Text:35.9→49.5 需专家、PRM 与分支执行
SOLAR-RL Findings ACL 2026 首个失败点与有效前缀 Android Control high:69.27 离线标签与 GUI 领域限定
DuCA ACL Industry 2026 turn/session 双 critic CVR:22.88%→24.44% 模拟器与商业指标限定
TRACE 2026 预印本 答案缺口 TD BrowseComp-Plus 4B:30.0→35.6 需要 gold answer
VPR 2026 预印本 可执行 oracle turn reward Sudoku:48.44→56.25 oracle 设计成本高
GraphGPO 2026 预印本 状态图距离 edge advantage 识别成功轨迹中的绕路边 图构建与状态规范化
AgentOPSD 2026 预印本 技能 teacher 的信念增量 ALFWorld:81.2→89.1 privileged skill 质量
ADRS 2026 预印本 return-gated token reward ALFWorld 3B:75.0→94.5 无策略不变性保证
EFCA 2026 预印本 短期反馈 + 中期历史 ALFWorld 1.5B:92.71→95.31(对 GraphGPO) 表面模式会误判探索
Credit Assignment Survey 2026 预印本 47 种方法统一分类 覆盖 token 到 multi-agent 综述,不是新算法

另外,Agentic ESOpt值得作为边界工作关注:它用 evolution strategies 在参数扰动层面对整条轨迹归因,绕开时间维度的 reward decomposition,在 WebArena-Lite 上把 Qwen3.5-27B 从 29.47 提升到 36.16。它不是 Agentic RL 的主流实现,却提醒我们:如果局部信用始终不可靠,直接优化 trajectory-level parameter attribution 可能成为另一条路线。

4. 两条主线在哪里相交

Long horizon 会放大信用分配问题,但两者不是包含关系。最清楚的方式是把“问题”和“方法”放进一张矩阵:

场景 Long-horizon 机制 细粒度奖励机制 为什么需要两者
50 轮 Web 搜索 subgoal、context compression、失败恢复 答案势差或 branch credit 前者防止迷路,后者判断哪次搜索真正推进答案
长 GUI 操作 milestone、checkpoint、局部重启 有效前缀与首个失败点 前者降低重试成本,后者定位错误动作
软件工程 Agent 层级计划、测试驱动阶段、仓库状态摘要 测试结果到 patch/command 的信用 只给 step reward 无法维护跨文件计划,只做计划又无法学习具体修改
长期记忆 Agent belief state、检索和遗忘策略 provenance 到 memory write 的回传 需要同时决定记什么,以及哪次记忆最终有用
真实异步服务 single-rollout critic、异步调度、状态持久化 turn advantage 与 off-policy correction 局部信用必须适应不能同步 group sampling 的系统

可以把完整训练栈写成三层:

\[ \text{Long-horizon architecture} \rightarrow \text{credit evidence router} \rightarrow \text{PPO/GRPO/actor-critic optimizer}. \]

第一层决定 Agent 如何分解任务、维护状态与恢复失败;第二层根据节点性质选择 oracle、势差、图比较、hindsight 或终局奖励;第三层才负责参数更新。工程中常见的错误是只替换最底层 optimizer,却没有改变前两层。

4.1 哪些方法同时解决两类问题

  • MiRA 与 BEACON:用 milestone 降低有效 horizon,同时产生 segment-level reward;
  • SUPO 与 MemAct:学习压缩/编辑状态,也必须为压缩动作分配长期信用;
  • WebAnchor:把长程规划与执行分开,再分别使用 dense 与 sparse reward;
  • SOLAR-RL:针对长 GUI 轨迹,用 failure point 把前缀与后缀分开;
  • Fine-Mem:长期记忆管理与 evidence-provenance credit 同时存在;
  • Turn-PPO:以环境 turn 对齐 value estimation,既适应多轮动力学,也改善局部优势。

4.2 如何为自己的 Agent 选择方法

先诊断问题是否真的来自信用分配:

观察到的失败 更可能的根因 优先方向
轨迹变长后几乎采不到一次成功 探索不可达 horizon curriculum、guidance、checkpoint、branch exploration
Agent 能找到局部答案,但逐渐忘记总体约束 状态表示失败 SUPO、MemAct、PACE、provenance-aware memory
第一步计划错误后整条轨迹持续偏离 计划稳定与恢复失败 WebAnchor、MiRA、FCPAgent
成功轨迹里有大量绕路,失败轨迹却包含正确前缀 信用分配失败 milestone、graph/branch credit、势差
同一任务 rollout 时长悬殊,训练经常等待最慢样本 系统与采样失败 single-rollout critic、异步训练、action-level scheduling

只有最后确认“局部动作得到了错误或不足的训练信号”后,才进一步选择下面的细粒度奖励方法。

情况 A:每一步都有可靠、便宜的可执行 oracle

优先 VPR 一类 verifier-based process reward。不要先训练 LLM PRM,因为程序验证器通常更准确、更可审计。先测量 verifier disagreement;弱 oracle 不应被高权重接入。

情况 B:只有终局标准答案,但可以评估中间状态的答题能力

优先 TIPS 或 TRACE。重视策略不变性和奖励守恒时,使用势差;想结合 GRPO 并强调局部 TD 进展时,TRACE 更直接。两者都要控制 teacher/reference 的计算成本与缓存。

情况 C:同题可以采多条轨迹,且状态会重复或共享前缀

优先 HGPO、SALT、GraphGPO 或 AT²PO。先解决 state canonicalization:网页 DOM、工具 JSON、路径和无关时间戳若不规范化,图方法很难找到共享节点。

情况 D:没有逐步标签,但训练期可提供技能、结局或完整上下文

考虑 HCAPO、AgentOPSD、ADRS。务必加入 outcome alignment、相关性门控、有界 multiplier 和消融;不要把 privileged teacher 的 token log-prob 直接当作真值。

情况 E:环境会返回结构化成功、错误和进度反馈

优先 EFCA;若 observation 本身可信且希望同时学习世界动力学,可叠加 SOAR 或 EnvRL 类辅助目标。对网页和用户输入先做来源隔离,避免把 prompt injection 作为监督学习进模型。

情况 F:只有少数节点真正决定成败

优先 STAPO 的不确定性筛选,或 CSO 的 verified counterfactual branch。把昂贵的 judge、PRM 和分支预算集中在高熵、失败翻转概率高的节点。

情况 G:同时有局部体验与终局业务目标

用 DuCA 式多 value head:按时间尺度分别估值、分别归一化、最后融合。直接求和会让方差或数值更大的 reward 主导训练。

情况 H:核心能力是长期记忆或证据管理

记录 provenance,再用 Fine-Mem 式 reward conservation 把终局收益回传到真正被引用的 memory write。没有证据链时,先完善 trace,不要急着上 token PRM。

5. 评估时最容易混淆什么

5.1 只报总成功率,不报 horizon 分层

至少按 turn 数、工具调用数和 observation token 数分桶。一个方法若只改善 5–10 轮任务,不能说明它获得了 50–100 轮的长程能力。AgentOPSD 的“每增加一轮成功率下降斜率”就是比单一平均分更有信息的指标。

5.2 把更密的奖励误当作更好的信用

应报告局部 reward 与最终 return 的相关性、符号一致率、reward flip rate,以及删除某个被高奖步骤后的反事实结果。ADRS 的 return-aware gate、CSO 的结果验证,都是在避免“密但错”。

5.3 忽略奖励守恒与长度偏差

若每一步都能获得正塑形,Agent 可能通过拖长轨迹刷分。TRACE 的 telescoping、Fine-Mem 的全局奖励守恒、potential-based shaping 都是在控制这一漏洞。论文和工程实现应检查:插入无信息步骤后总 shaped reward 是否改变。

5.4 不核算额外信号的真实成本

统一报告:

  • rollout token 与 environment step;
  • teacher / critic / PRM 前向次数;
  • 分支执行、网页请求和代码沙箱成本;
  • wall-clock、训练 GPU 与外部 CPU;
  • 每个成功任务的总成本。

SALT 几乎只增加图聚合时间,TIPS 增加 teacher 评分,HCAPO 需要 hindsight audit,CSO 需要反事实分支。只比较训练 step 数会掩盖巨大差异。

5.5 不测试错误反馈和奖励攻击

需要主动注入:

  • 错误工具返回与过期网页;
  • prompt injection 和恶意 observation;
  • verifier bug 与 reward model 偏好;
  • 局部负反馈但全局必要的探索动作;
  • 可逆与不可逆操作混合的长任务。

细粒度信号越强,错误信号被策略放大的速度也越快。

6. 我对下一阶段的判断

6.1 时间抽象会比无限延长 context 更重要

更大的 context window 能缓解截断,却不会自动产生子目标、技能终止条件和失败恢复。未来系统会把大量原子动作封装为可验证的 option,让上层策略只处理少数真正改变任务方向的决策。

6.2 状态管理会成为策略的一部分

摘要、记忆写入、证据保留、checkpoint 和遗忘不再只是固定 harness。SUPO 与 MemAct 已经展示了端到端优化的早期形态;下一步需要把压缩状态的充分性、可恢复性和 value calibration 一起纳入训练。

6.3 turn 会成为默认优化单位,token 退回实现层

token loss 仍用于反向传播,但 value、importance ratio、clipping、分叉与成本会更多地以 turn 计算。它与环境状态转移天然对齐,也比完整 trajectory 更容易归因。

6.4 主流方法会从“单一奖励”变成“证据路由”

未来系统不会只选一个 reward model,而会根据节点类型路由信号:可执行步骤用 oracle,搜索状态用答案势差,重复状态用图比较,高熵节点做反事实分叉,记忆写入用 provenance,终局再由真实任务验证器兜底。

6.5 信用分配会与探索调度合并

只有分叉过的节点才有较强反事实证据;只有获得精确信用的节点才值得继续分叉。因此 AT²PO、CSO、STAPO 一类“先定位关键点,再投入 rollout/验证预算”的方法会比均匀 dense reward 更可扩展。

6.6 长 horizon 课程会成为算法的一部分

短任务不仅用于 cold start,还能让策略先学习可复用局部技能,再测试 horizon generalization。课程不应只按题目难度排序,还应显式控制有效决策数、失败恢复次数、记忆跨度和工具延迟。

6.7 最终瓶颈是可信的局部证据,而不是奖励数量

Agent 可以从 judge、teacher、环境文本和自我反思中生成无限多“奖励”,但真正稀缺的是能经受反事实检验、不会鼓励拖延、可在分布外保持可靠的局部证据。2026 年最有价值的工作,几乎都在用守恒、门控、共享状态、可执行验证或结果翻转来提高这种证据质量。

7. 结语

Long-horizon 与细粒度奖励最后可以分别压缩成两组问题。

Long horizon 关注:

  1. 可达性:能否探索到成功区域;
  2. 时间抽象:能否把长轨迹压缩为少数 subgoal 和 option;
  3. 状态:能否保留支持后续决策的 belief state;
  4. 恢复:偏离计划后能否检测、回退和修复;
  5. 系统与评估:能否经济地训练,并证明能力随 horizon 延伸。

细粒度奖励关注:

  1. 对象:奖励 turn、step、edge、observation、token 还是 memory operation;
  2. 证据:来自 oracle、反事实、势差、teacher 还是 outcome;
  3. 约束:是否守恒、是否产生长度偏差、是否会被 reward hacking;
  4. 接入:怎样与 PPO、GRPO 或 critic advantage 结合。

因此,PPO、GRPO、actor-critic 只是优化外壳。长程能力的上限主要由层级策略、状态表示、探索与恢复决定;局部学习效率则取决于信用证据是否可靠。对细粒度信号而言,仍可遵循:

可执行验证 > 受控反事实 > 守恒势差 > 有门控的 teacher 信号 > 无约束的稠密评分。

如果只用一句话概括 2026 年的前沿:Long-horizon 研究正在设法让轨迹不再“有效地那么长”,细粒度奖励研究则在回答剩余每个关键决策究竟值多少信用。


2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
https://kissshhot.github.io/2026/09/01/agentic-rl-2026-frontier-and-paradigms/
作者
丁一帆
发布于
2026年9月1日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。