Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励

一句话结论:SVM 用判别器估计某个 state-action 更像来自成功 episode 还是失败 episode,并把 log-odds 作为稠密 shaping reward;在确定性环境和论文的计数估计条件下,最大化该奖励仍会最大化原始成功概率。

论文信息

  • 标题:Learning Process Rewards via Success Visitation Matching for Efficient RL
  • 作者:Tsao et al.
  • 版本:arXiv:2606.23640,2026
  • 论文arXiv:2606.23640
  • 项目页success-visitation-matching.github.io
  • 实验域:机器人控制;论文只把 LLM RLVR 列为未来应用方向

1. Motivation:只有成功那一刻得 +1,前面的动作怎么学

许多机器人任务在完成时给 1,其余时刻全为 0。最自然的 process reward 应该回答:当前 state-action 是否更常出现在最终成功的 episode 中?

SVM 的关键约束是:dense reward 不能只让训练更快,还应尽可能保持原始 outcome objective 的最优策略,避免 reward shaping 把 Agent 带向一个“分高但不完成任务”的捷径。

2. Method

2.1 成功与失败的访问分布

把历史 episode 分成成功集 (D^+) 和失败集 (D^-)。令

\[ \widehat w_h^+(s,a),\qquad \widehat w_h^-(s,a) \]

分别表示第 (h) 步在成功/失败 episode 中访问 ((s,a)) 的密度。SVM reward 为

\[ r_h^{\mathrm{svm}}(s,a) =r^{\mathrm{out}}(s) +\lambda\operatorname{clip}_\beta \left( \log\frac{\widehat w_h^+(s,a)} {\widehat w_h^-(s,a)} \right). \]

若某动作更多出现在成功轨迹,log ratio 为正;更多出现在失败轨迹则为负。() 防止有限样本下的极端比值主导训练。

2.2 为什么训练一个判别器就够

高维图像状态无法显式做密度估计。训练二分类器 (f(s,a)) 区分 (D^+) 与 (D^-),理想最优分类器满足

\[ f^*(x)=\frac{P(x)}{P(x)+Q(x)}. \]

因此

\[ \frac{P(x)}{Q(x)}=\frac{f^*(x)}{1-f^*(x)}. \]

实际 shaping 项写为

\[ \lambda\operatorname{clip}_\beta \left(\log\frac{\widehat f(s,a)}{1-\widehat f(s,a)}\right). \]

算法在线交替执行:rollout 新 episode、按结果加入正/负集合、更新 discriminator、再用新的 SVM reward 更新 RL policy。

2.3 理论含义

论文 Theorem 4.1 证明:在确定性转移、可数状态动作空间、计数访问估计下,对任意 (,>0),最大化 (r^{}) 的策略也最大化原 outcome reward。

当不裁剪时,期望 shaping 项可写为

\[ \sum_h \left[ \operatorname{KL}(w_h^\pi\|\widehat w_h^-) -\operatorname{KL}(w_h^\pi\|\widehat w_h^+) \right]. \]

即策略一面远离失败访问,一面接近成功访问。

3. 具体数值推演

设 (,)。

3.1 看起来像成功访问的中间动作

判别器输出 (f(s,a)=0.8),则

\[ \frac{\widehat f}{1-\widehat f}=\frac{0.8}{0.2}=4, \qquad \log4\approx1.386. \]

裁剪到 ([-1,1]) 得 1。若此时 outcome reward 为 0:

\[ r^{\mathrm{svm}}=0+0.2\times1=0.2. \]

Agent 在尚未完成任务时已经得到正过程信号。

3.2 看起来像失败访问的动作

若 (f=0.2):

\[ \log\frac{0.2}{0.8}=\log0.25\approx-1.386, \]

裁剪后

\[ r^{\mathrm{svm}}=0+0.2(-1)=-0.2. \]

3.3 最终成功状态

若 outcome reward 为 1 且 (f=0.9),log-odds 约 2.197,裁剪为 1:

\[ r^{\mathrm{svm}}=1+0.2=1.2. \]

原始任务完成信号始终保留;过程项只是在到达终点前提供方向,并通过裁剪限制幅度。

4. Results:这是机器人论文,不是 LLM 实验

论文评测 LIBERO-90、RoboCasa、真实 WidowX、Robomimic,以及 3.3B 参数 VLA (_0) 的 RL finetuning。

  • 在 LIBERO 三个 kitchen scene、DSRL 与 Residual RL 两类 optimizer 上,SVM 相对 outcome-only 和多种 shaping baseline 更快收敛,最终成功率通常也更高。
  • Residual RL 中多项任务达到相近收敛水平所需样本约减少 2 倍或更多;最终表现普遍超过 80%。
  • RoboCasa 三项任务上,SVM 很快达到约 90% 成功率,而对照 shaping 方法基本没有带来有效改进。
  • 真实 WidowX 三项任务均在较少环境步内超过 80%;其中 Pick and Place 与 Open Drawer 的 outcome-only RL 没有学起来。
  • 对 (_0) 的四个 LIBERO 任务,SVM 达到 90% 成功率约需 outcome-only 一半环境步。
  • 消融表明:直接最大化 discriminator、采样候选动作、BC 成功轨迹都不如把 log-odds 作为 RL reward;显式使用失败集作为负反馈也很重要。

论文没有在 LLM/RLVR 上做实验。把它应用到 LLM 时,应写作“方法可迁移假设”,不能把机器人结果当成 LLM 已验证结论。

5. 最具创新的点

最创新之处是把“成功轨迹像 expert”与在线 outcome labeling 结合:它不要求预先给定 expert demonstration,正样本会随策略发现新成功方式持续更新;同时负样本不是所有当前 policy rollout,而是明确失败的 episode。

6. 不足与可能改进

6.1 最优策略保证依赖确定性

现实机器人有感知与执行噪声,LLM Agent 的网页/API 环境也会随机变化。相同 ((s,a)) 未必再次成功。应扩展到随机 MDP 的条件保证,并报告 checkpoint replay 的方差。

6.2 discriminator 学的是相关访问,不是必要动作

成功 episode 里常见的背景或绕路也会被奖励;失败 episode 中的正确早期动作也可能被惩罚。可加入时间、任务条件、counterfactual replay 或 advantage residual 以减少混杂。

6.3 早期没有成功样本时无法启动

若 base policy 成功率为 0,(D^+) 为空。论文在部分设置用预训练策略 rollout 或 demonstration 初始化。更难任务需要 curriculum、探索 bonus 或自动子目标先制造首批成功。

6.4 在线分类分布不断漂移

正负集合不平衡、旧数据和新策略不匹配会导致 calibration drift。可用滑动窗口、balanced replay、temperature calibration 与 ensemble uncertainty。

6.5 迁移到 LLM 需要定义“状态动作”

逐 token 密度维度过高且包含大量格式相关性;更合理的单位可能是 reasoning segment、tool call 或环境 turn。还需防止 discriminator 利用长度、模板等捷径。

7. 阅读结论

SVM 是一条很干净的 reward-shaping 路线:用已观察到的成功/失败访问比产生 dense signal,并保留 outcome reward。它在机器人 RL 上证据充足;对 LLM credit assignment 的价值很有启发,但目前仍待直接实验验证。

参考入口

  • reward 与理论:第 4.1 节,式 (1)、Theorem 4.1
  • discriminator 与在线算法:第 4.2 节,式 (2)、Algorithm 1
  • 实验:第 5 节,图 3–14

Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励
https://kissshhot.github.io/2026/08/20/process-rewards-success-visitation/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。