从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon

大语言模型执行长任务时,可能一直收不到成功奖励,也可能偶尔成功,却学不会哪些步骤值得保留。这两种失败需要不同的解决方法。回看 LLM 兴起之前的研究,奖励重分配、目标重标注、时间抽象和历史压缩,提供了几条值得重新实验的路线。

本文收集 1991—2019 年的 12 篇论文,涵盖早期神经网络与深度强化学习,并补入两篇非深度学习的理论基础。优先推荐 RUDDER、HER、FeUdal Networks:分别对应终局奖励归因、失败轨迹复用和缩短高层决策跨度。

这是一份面向研究选题的阅读地图。论文机制依据所链接的原始论文及作者资料整理;文中的 LLM 迁移方案和实验设计是独立研究设想,不代表原论文已经在 LLM 上验证,也不构成对这些方向新颖性的判断。

先诊断:稀疏奖励与长程任务不是一个问题

稀疏描述反馈出现得少,延迟描述反馈距离相关动作很远;long horizon 则涉及任务需要跨越的决策跨度。三者经常同时出现,但不应混为一谈。

训练现象 优先检查的瓶颈 对应阅读
大部分 rollout 都失败,几乎没有正奖励 探索不足、有效经验不足 HER、伪计数探索、ICM
偶尔成功,但无法稳定重复关键操作 长程信用分配 RUDDER、TVT
子任务会做,组合起来就失败 时间抽象、技能组合 Options、h-DQN、FeUdal
后期丢失早期事实,或被冗长日志干扰 历史表示、记忆 History Compression、LSTM
有大量交互数据,但终局监督利用率低 表示学习与辅助目标 UNREAL

还要区分 token 长度与环境交互轮数。一次工具调用可以包含大量 token;一个高层技能可以执行多次工具调用。减少高层步数不自动意味着减少总计算量,也不自动解决低层策略的信用分配。

第一条线:把终局反馈传回关键事件

1. RUDDER:将回报预测转化为奖励重分配

Arjona-Medina 等,2018 预印本/NeurIPS 2019。 RUDDER: Return Decomposition for Delayed Rewards

RUDDER 用序列模型预测轨迹回报,通过贡献分析将奖励重新分配到相关的状态—动作位置。原论文研究回报等价的奖励重分配;理想情况下,期望未来奖励为零,价值估计便更容易。

对 LLM 的启发是:只有最终验证结果时,能否先训练一个轨迹前缀回报预测器,再把信号分配给“找到关键证据”“修正错误假设”“完成必要修改”等事件?这可能减少对人工过程标注的依赖。

必须警惕的是,某一步让成功预测上升,可能仅仅因为它暴露了已有信息。模型在“宣布完成”时变得确信成功,不代表宣布本身创造了成功。需要用替换动作、重新执行等方式检查归因质量。

2. Temporal Value Transport:借助记忆连接遥远事件

Hung 等,2018 预印本/2019 发表。 Optimizing Agent Behavior over Long Time Scales by Transporting Value

TVT 借助记忆读写与检索关联,把后期价值信息传回较早的相关事件,为长程信用分配提供跨越时间间隔的路径。

迁移到检索 Agent,一个自然问题是:最终答案使用了很早以前获取的证据,能否将学习信号传回当时的检索动作?这比给全部历史步骤同样的终局回报更有针对性。

但“被检索到”不等于“对结果有因果贡献”。检索权重可以作为候选关联,仍需验证证据是否正确、必要,以及替代证据是否同样有效。

3. 奖励塑形:增加中间奖励时,如何保持目标

Ng、Harada、Russell,ICML 1999。 Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping

这篇非深度学习论文提供势函数奖励塑形的理论基础。典型形式是:

\[ r'_t=r_t+\gamma\Phi(s_{t+1})-\Phi(s_t). \]

其价值在于说明:保持最优策略需要满足结构性条件,并非任意“看起来合理”的过程奖励都可以。对于有限回合,还需正确处理终止状态的势函数,避免残留项随策略变化。

对 LLM,给格式、解释长度或自述进展直接加分,可能改变原始目标。势函数框架为过程奖励设计提供参照,但不能直接担保不断更新的神经奖励模型、截断轨迹或不完整状态表示下的整个训练系统。

第二条线:利用失败轨迹,并主动获得新经验

4. Hindsight Experience Replay:失败相对于哪个目标?

Andrychowicz 等,2017。 Hindsight Experience Replay

HER 将未实现原目标的轨迹,按实际达到的目标重新标注,用于目标条件策略的 off-policy 学习。原论文在稀疏二元奖励的机器人操作任务中验证这一机制。

对代码 Agent,一条未能修复问题的轨迹,可能已经成功复现报错或定位相关函数。可以将这些片段转化为对应子任务的数据,前提是通过环境检查确认目标完成。

自然语言重标注更容易发生语义漂移:不能随意把错误答案改写成一个“成功目标”,也不能忽视更换目标后动作是否仍然合理。实践上可以先验证目标条件监督训练的收益,再研究旧轨迹进入 RL 的方式;不能把 HER 直接等同于复用旧 PPO rollout。

5. 伪计数探索:奖励新的状态,而非新的措辞

Bellemare 等,NeurIPS 2016。 Unifying Count-Based Exploration and Intrinsic Motivation

论文从密度模型构造伪计数,把基于访问次数的探索思想扩展到高维状态空间,并将其用于 Atari 探索。

对 LLM Agent,可以研究基于环境状态或解决路径的探索奖励。难点是状态抽象:不同措辞可能表达同一状态,而相似页面也可能具有不同的关键权限或任务进度。直接对文本字符串计数,很容易奖励无意义的变化。

6. ICM:预测动作后果,产生内在奖励

Pathak 等,ICML 2017。 Curiosity-driven Exploration by Self-supervised Prediction

ICM 在逆动力学任务学习的特征空间中,用动作后果的预测误差构造好奇心奖励。它为外部奖励稀少时的探索提供额外驱动力。

对工具 Agent,可以预测一次操作会怎样改变文件、页面或执行状态,并探索尚不熟悉的转移。但不能把高语言困惑度直接当成有用的新颖性;随机输出与无关变化也可能难以预测。实验应检查探索是否提高最终任务成功率。

第三条线:改变决策的时间尺度

7. Options:把一段策略定义为高层动作

Sutton、Precup、Singh,1999。 Between MDPs and Semi-MDPs: A Framework for Temporal Abstraction in Reinforcement Learning

Options 框架把跨越多个时间步的策略纳入强化学习。一个 option 包含启动条件、内部策略和终止条件。这也是本文另一篇非深度学习的理论基础。

对 LLM,“查找定义”“运行并解释测试”“完成一次局部修复”可以作为技能候选。真正需要明确的是何时启动、根据哪些观察执行,以及成功或失败时怎样终止。只有技能名称,没有执行与结束语义,还不足以构成有效的时间抽象。

8. h-DQN:让高层学目标,低层学达成目标

Kulkarni 等,NeurIPS 2016。 Hierarchical Deep Reinforcement Learning: Integrating Temporal Abstraction and Intrinsic Motivation

h-DQN 使用不同时间尺度的价值函数:高层选择内在目标,低层选择达成目标的原子动作。达成子目标的内在反馈帮助探索稀疏奖励环境。

在代码任务中,可以研究“复现问题→定位原因→修复→验证”的目标结构。但这个分解只是实验候选,不能预设它适合全部任务。高层应学习选择有助于终局成功的目标,低层应通过可检查的完成条件获得反馈。

9. FeUdal Networks:不同层级使用不同时间尺度

Vezhnevets 等,ICML 2017。 FeUdal Networks for Hierarchical Reinforcement Learning

FeUdal Networks 使用较慢的 Manager 提出抽象目标,较快的 Worker 执行原子动作,通过不同时间分辨率组织学习。

对 LLM 的重点启发是训练结构:高层不必为每一个 token 或工具细节重新决策,而可以选择持续若干步的目标。仅使用 Planner/Executor 提示词,不等于复现这一学习机制。

评估时应同时统计高层决策数、低层调用数、总 token 和最终成功率。否则,把一百次底层动作包装成十次技能调用,会造成跨度已解决的错觉。

第四条线:让长历史更容易被学习和使用

10. History Compression:以不可预测事件构建慢时间尺度

Schmidhuber,NeurIPS 1991。 Learning Unambiguous Reduced Sequence Descriptions

这篇早期研究让低层网络预测序列,将不可预测的输入及其时间信息交给更高层,逐层形成更慢、自适应的时间尺度。

对长工具日志,可以探索事件驱动的历史压缩:高层主要处理关键状态变化,低层保留必要的原始细节。但意外程度与任务价值不是同一个量。一个完全可预测的权限变化,也可能决定后续操作是否成功。

因此,LLM 迁移版本需要结合任务相关性、可恢复的原始记录和证据引用。原方法的描述压缩思想不能直接担保现代有损摘要不会遗漏关键事实。

11. LSTM:记忆问题与奖励归因需要分别处理

Hochreiter、Schmidhuber,1997。 Long Short-Term Memory

LSTM 针对长时间间隔上的误差信号传播与信息保存设计记忆机制。阅读它的价值在于理解长依赖为何难学,而非直接建议将 Transformer 换成 LSTM。

一个 Agent 即使记得早期观察,也仍可能不知道应当强化哪次操作。反过来,归因方法再好,如果策略看不到必要历史,也无法稳定执行。记忆与信用分配应分别设置消融实验。

12. UNREAL:没有外部奖励时,继续学习表示

Jaderberg 等,2016 预印本/ICLR 2017。 Reinforcement Learning with Unsupervised Auxiliary Tasks

UNREAL 通过奖励预测、像素控制等辅助任务改善共享表示,让智能体在外部奖励缺失时仍能利用交互经验学习。

对 LLM,可以增加工具结果预测、状态变化预测或子目标可达性预测。关键对照是已有语言预训练:辅助任务是否带来了额外的决策相关信息,还是只增加了一个容易优化、却不影响最终成功的损失?

三个优先实验

以下方案是基于上述论文的研究设计,不是原论文结果。

实验 A:不依赖人工过程标注的奖励重分配

选择有确定终局验证器的任务,以完整轨迹训练前缀回报预测器。令 \(h_t\) 是第 \(t\) 步之后的历史,\(f(h_t)\) 预测终局回报。可以将相邻预测差作为初始贡献估计:

\[ \Delta_t=f(h_t)-f(h_{t-1}). \]

但差值和为 \(f(h_T)-f(h_0)\),并不天然等于真实终局回报 \(R\)。对未折扣的终局奖励,一种简单的总量校正是将 \(R-f(h_T)+f(h_0)\) 加回末步。它保证轨迹回报总量一致,却不保证预测归因准确,也不保证剩余末步信号足够小。

例如,自构造的三步轨迹预测从 \(0.1\) 变为 \(0.2、0.7、0.8\),差值为 \(0.1、0.5、0.1\)。若最终成功得到 \(R=1\),还需校正 \(0.3\)。第二步预测变化最大,但仍需检查它是否真的比其他步骤更有贡献。

对照终局奖励基线,测量相同采样预算下的成功率,并对高贡献步骤做替换后重新执行。总量守恒只是起点,不能代替归因验证。

实验 B:可验证子目标上的分层策略

先定义少量具备启动和终止条件的技能,训练高层选择目标、低层完成执行。逐步增加任务链长度,观察成功率曲线,而不是只比较一个固定难度上的平均分。

对照应包括原子动作策略,以及使用同一技能库但固定高层规则的系统。这样才能区分收益来自技能封装,还是来自高层学习。预算同时约束总 token、工具调用和环境执行成本。

实验 C:从失败轨迹提取可验证子任务

从失败轨迹提取实际完成的子目标,经环境验证后生成目标条件训练数据。先做监督训练,以较低实现成本验证数据价值,再研究 off-policy RL。

对照组使用相同数量的未重标注经验;评估包括原始完整任务、被重标注的子任务和未见目标。只提高子任务分数而不改善完整任务,不足以说明长程能力提升。

阅读顺序与选题建议

建议顺序是 RUDDER → 奖励塑形 → HER → Options → FeUdal → History Compression。先理解学习信号如何改变,再理解动作与历史的时间尺度如何改变。

如果主要研究只有最终答案奖励的推理训练,优先考察奖励重分配与归因验证。如果主要研究长链工具 Agent,优先考察可验证子目标、失败轨迹复用和分层策略。若日志增长导致信息丢失,则将历史压缩作为单独变量实验,避免把记忆改善误判为信用分配改善。

这些旧论文最有价值的地方,是帮助把一个笼统的“长任务难训练”问题,拆成可以分别干预和验证的机制。


从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
https://kissshhot.github.io/2026/09/08/early-deep-learning-sparse-rewards-long-horizon/
作者
丁一帆
发布于
2026年9月8日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。