Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励
一句话结论:SVM 用判别器估计某个 state-action 更像来自成功 episode 还是失败 episode,并把 log-odds 作为稠密 shaping reward;在确定性环境和论文的计数估计条件下,最大化该奖励仍会最大化原始成功概率。 论文信息 标题:Learning Process Rewards via Success Visitation Matching for E