Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子
Long-horizon 不只是把上下文窗口扩大,也不只是让 Agent 多运行一会儿。真正需要训练的问题是:模型能否从有限的成功和大量的失败中,学会持续规划、正确执行、保存关键信息,并在偏离目标后恢复?
这篇文章整理 20 篇涉及模型参数更新的代表性论文,按训练对象和训练信号分成七条路线:能力底座、失败轨迹学习、课程与跨度缩减、层次策略、局部信用分配、记忆训练,以及训练系统。重点是 LLM Agent 的多轮环境交互;同时明确标注长链推理、记忆代理任务等相邻方向,不把它们当作同一种 long-horizon 证据。
检索与版本核对截至 2026-09-07,主要覆盖 2024–2026 年工作。这是一份面向阅读和实验选型的代表性清单,不是穷尽性系统综述。HSL、MEM1、BEACON、SWE-MeM 与 Horizon Length 实证研究的关键方法、公式和表格经过正文核对;其他条目用于路线定位,依据论文摘要及可访问的方法章节,不表示已经完成逐篇复现。
1. 先划清范围:这里的“需要训练”是什么意思?
本文的纳入条件是:方法包含通过数据或环境反馈更新模型参数的环节,例如监督微调(SFT)、强化学习(RL)、持续预训练(CPT)或在线策略蒸馏(on-policy distillation,OPD)。论文也可以包含无需训练的运行框架,但必须分清训练本身与框架带来的收益。
只修改 prompt、检索已有记忆、在上下文中反思、增加搜索分支,或者向外部文件写入经验,而不更新模型参数的方法,不列入主清单。反过来,利用反思文本构造 SFT 数据,就属于训练。
另一个重要边界是长度的单位。
| 问题 | 所谓“长”在数什么? | 本文如何处理 |
|---|---|---|
| 多轮 Agent | 观察—决策—动作—环境反馈的轮数 | 主线:网页、代码、文本环境、交互式规划 |
| 多步推理 | 推理链或依赖子问题的深度 | 纳入 h1 等相邻研究,但单独标注 |
| 长上下文 | 当前输入或历史的 token 数 | 记忆训练的资源约束,不等于任务步数 |
| 长时间运行 | 墙钟时间、工具等待或超时预算 | 必须结合真实决策数和成功率解释 |
因此,本文不是通用长上下文模型清单,也不试图覆盖所有机器人控制和经典层次强化学习论文。
为什么值得专门研究训练?
长任务同时放大了几个缺口:成功轨迹难以采到;终局失败无法指出哪一步有问题;长历史可能挤掉关键状态;只模仿专家成功路径的模型,遇到自己的错误后未必知道如何恢复。
不同论文其实在回答不同的问题。把它们都归成“更好的 GRPO”会丢失最有价值的区别:有的改变训练数据,有的改变决策单位,有的改变 advantage 的比较对象,还有的训练记忆动作。
2. 总体地图:先找瓶颈,再选论文
以下分组按主要贡献划分,每篇只计数一次;同一方法可以同时涉及多条路线。
| 路线 | 主要瓶颈 | 代表论文 | 更新什么 |
|---|---|---|---|
| 能力底座与蒸馏 | 缺少状态转移、工具使用或组合能力 | Agentic CPT、Physics of Multi-Turn Planning | 基础模型或学生策略 |
| 失败轨迹学习 | 成功示范少、不会纠错、失败数据被丢弃 | Agent-R、STeCa、HSL | Agent 策略 |
| 课程与跨度缩减 | 长任务起步困难、终局反馈太远 | WebRL、h1、Horizon Length | 随任务分布或动作接口变化的策略 |
| 层次策略 | 规划与执行混在一条平坦轨迹里 | ArCHer、HiMAC | 策略与价值函数,或不同角色的策略目标 |
| 局部信用分配 | 正确前缀被后续失败连带惩罚 | GiGPO、HGPO、MiRA、BEACON、VPR | 使用局部训练信号的策略 |
| 记忆训练 | 历史过长、摘要失真、忘记未来要用的信息 | MEM1、MemAct、MemTrain、SWE-MeM | 记忆更新及相关行动策略 |
| 训练系统 | 长 rollout 和长序列训练成本过高 | SINKFLEX-RL | 在更高效基础设施上优化工具使用策略 |
3. 七条路线与 20 篇论文
3.1 能力底座:先学会环境规律,再谈长程优化
[01] Scaling Agents via Continual Pre-training(2025,Agentic CPT / AgentFounder)
核心问题是:Agent 能力是否只能依靠后训练获得?这项工作把面向 Agent 的持续预训练放到训练流水线更早的位置,再衔接后训练。它适合回答如何构建工具使用和交互能力的底座,而不是某个新的长轨迹 advantage 估计器。
- 训练对象与信号:基础模型参数;Agent 相关语料上的持续预训练,再接后续训练阶段。
- 阅读价值:把数据配方和训练阶段纳入讨论,避免所有短板都归因于 RL 算法。
- 边界:广义 Agent 能力提升,不等于在其他难度固定时,单独证明了 horizon 泛化。
这项受控研究连接了预训练中的状态转移学习与后训练中的长程规划。论文比较强化学习与单教师、多个教师的 OPD:学生在自己访问到的状态上接受教师指导,而不仅是离线模仿教师完整轨迹。
- 训练对象与信号:预训练模型及学生策略;状态转移数据、环境回报、教师在学生轨迹上的指导。
- 阅读价值:讨论原子能力怎样组合成长任务,以及教师能力互补或冲突如何影响迁移。
- 边界:受控环境中的结论不能直接推出“蒸馏在所有真实 Agent 任务上都优于 RL”。
3.2 失败轨迹学习:让数据不再只有“整条成功”这一种标签
[03] Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training(2025)
Agent-R 的重点不是运行时加一句“请反思”。它借助搜索得到失败与成功路径,定位错误并构造恢复轨迹,再迭代自训练,让模型学会在自己可能遇到的错误状态中纠正行动。
- 训练对象与信号:Agent 参数;由搜索、反思和纠正路径构造的监督数据。
- 最值得关注:训练分布包含失败后的状态,而不只是理想专家路径。
- 代价:搜索和轨迹构造不是免费的;模型必须能获得有质量的替代路径。
[04] STeCa: Step-level Trajectory Calibration for LLM Agent Learning(2025)
STeCa 逐步比较轨迹,定位与专家行为发生偏离的位置,利用反思和专家信息构造校准轨迹。它在 SFT 暖启动后使用强化训练,并用轨迹偏离程度设计学习信号;正文讨论了基于归一化动态时间规整(nDTW)的度量。
- 训练对象与信号:Agent 策略;专家轨迹、校准轨迹与轨迹级偏离度量。
- 最值得关注:把“哪里偏离、如何回到有效路径”转成训练信息。
- 边界:不能简单把它写成纯 SFT。专家轨迹及外部反思模型也是方法的资源前提。见方法正文。
[05] Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations(2026,HSL)
Hindsight Supervised Learning(事后监督学习,HSL)换了一个问题:原目标虽然失败,这条轨迹是否成功完成了另一个合理目标?辅助 LLM 为已经发生的行为重标目标,再筛出与新目标相关的动作做监督训练。
- 训练对象与信号:主 Agent;重标注目标、动作相关性标签,以及原有专家示范。
- 最值得关注:把部分成功变成可学习的完整示范,而不是伪造原任务已经成功。
- 代价:依赖重标注的真实性和目标覆盖;仍需要原始示范稳定训练,不能称为完全不需要监督资源。第 4 节给出完整数值例子。
3.3 课程与跨度缩减:让策略先获得可学习的成功信号
[06] WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning(2024)
WebRL 让在线训练任务分布随 Agent 的表现演化,从失败尝试中构造新任务,并结合结果奖励模型和策略优化处理分布变化。
- 训练对象与信号:网页 Agent 策略;在线任务、环境轨迹与结果奖励。
- 最值得关注:课程不只是预先按步数排好顺序,也可以从当前策略的失败模式中生成。
- 边界:任务生成质量、奖励可靠性和覆盖范围会共同影响结果,不能把收益全归结为“先短后长”。
[07] h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning(2025)
h1 将较短数学问题组合成具有依赖关系的更长问题,再用 RL 训练模型处理更深的推理链。它提供了一种可控地增加依赖深度的任务构造思路。
- 训练对象与信号:推理模型;组合问题与可验证的最终答案。
- 最值得关注:任务生成器可以主动控制训练 horizon,而不只是从既有数据中筛长答案。
- 边界:这是长链推理的相邻方向。数学问题依赖深度不能直接换算成浏览器或代码 Agent 的环境交互轮数。
[08] On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length(2026)
论文尽量控制局部解题规则,用数独与 Rush Hour 检查任务跨度对训练的影响。两条核心干预分别是:一次决策执行多个底层动作;在可验证子目标处切开回报计算。
- 训练对象与信号:先 SFT、再 RL 的策略;终局结果、动作约束和子目标奖励。
- 最值得关注:宏动作缩短交互轮数,子目标切分缩短信用传播距离,二者不是同一件事。
- 边界:动作接口改变后,一个“step”的工作量变了;宏动作还可能使用不同回复长度预算。更长同类任务上的泛化,也不代表自动学会新解题技巧。
完整方法、实验与数独数值推演见:长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法。
3.4 层次策略:在什么粒度上学习决策?
[09] ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL(2024)
ArCHer 区分整段语言动作与内部 token 生成:高层利用离策略价值学习评价多轮交互中的语言动作,低层语言模型再利用该价值信号更新 token 策略。
- 训练对象与信号:价值模型与语言策略;交互回报和价值估计。
- 最值得关注:把跨轮决策学习与语言生成的粒度分开。
- 边界:这里的“层次”不应误写成一个自然语言 Planner 加一个 Executor;它主要是语言动作级与 token 级的分层。见 ICML 2024 正式版本。
[10] HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents(2026)
HiMAC 才是显式的计划—执行分工:宏观角色生成子目标蓝图,微观角色按照当前子目标执行。它用分层组内比较构造训练信号,并交替优化规划和执行。
- 训练对象与信号:同一个底层 LLM 的参数,分别通过蓝图 token 和动作 token 的目标更新;不需要额外价值网络。
- 最值得关注:规划候选之间比较、同一蓝图下的执行轨迹之间比较,避免把两种质量混为一谈。
- 边界:两种角色不是必然对应两套独立模型;生成合理子目标和正确判断完成条件仍有要求。见正文 §3。
3.5 局部信用分配:把一次终局输赢拆成可学习的差异
| 编号与论文 | 训练信号怎样产生? | 关键贡献与成立条件 |
|---|---|---|
| [11] GiGPO(2025) | 结合整条轨迹的组内优势与重复锚点状态处的动作比较 | 在已有 rollout 中寻找局部可比较样本,不额外训练 critic;状态能否可靠匹配很重要 |
| [12] HGPO(2026) | 在不同粒度的历史匹配组中估计、聚合优势 | 用层次化分组处理偏差—方差权衡;不能把“观察文本相同”直接视为“决策条件相同” |
| [13] MiRA / A Subgoal-driven Framework for Improving Long-Horizon LLM Agents(2026) | 用子目标完成情况提供稠密 milestone 奖励并做 RL | 本文只纳入其 RL 部分;论文同时研究了无需训练的子目标推理框架,二者不能混报 |
| [14] BEACON(2026) | 按里程碑划分轨迹,片段内时间塑形,再结合局部与全局优势 | 保留部分进展的学习价值;需要任务结构支持可靠的里程碑识别 |
| [15] VPR: Verifiable Process Rewards for Agentic Reasoning(2026) | 借助符号或算法验证机制,为交互过程提供可验证反馈 | 过程反馈比单纯终局奖励更具体;适用范围取决于过程能否被验证,验证器开发成本不能忽略 |
这五篇主要更新的是 Agent 策略,但“局部信号”的来源不同:GiGPO / HGPO 更偏向已有样本之间的比较结构;MiRA / BEACON 更依赖子目标结构;VPR 更依赖可验证过程。
以 BEACON 为例,完成早期里程碑的轨迹即使最终失败,仍可提供局部学习信号。它同时保留整条轨迹的结果优势,并在到达同一里程碑的轨迹之间比较片段表现。因而不是“奖励拆开就不管最终任务了”,而是让局部进展与最终目标共同影响更新。(BEACON 正文 §3.3–3.5)
VPR 此处按 arXiv v2 核对;该版说明修正了涉及 LLM 辅助提取的错误。阅读时应记录版本,不把不同版本的数字拼成同一个实验结果。
3.6 记忆训练:学习的不是摘要文风,而是未来还能否完成任务
[16] MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents(2025)
MEM1 将历史压缩成持续更新的内部状态,再结合最新信息完成下一轮推理与行动。训练通过 RL 让记忆选择服务于任务结果,而不只是追求摘要与原文相似。
关键实现问题在于:生成某一步时已经删除的旧历史,训练算概率时也不能重新看见。论文用注意力与损失掩码复现各轮真正可见的上下文,外部返回信息也不能被当作模型生成目标。(正文 §3)
- 训练对象:生成内部状态、推理和行动的模型。
- 边界:窗口不会随全部历史线性累积,不等于记忆无损,更不代表任务完成能力可以无限延伸。第 5 节会解释其“3.5 倍”指标的实际含义。
[17] Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks(2025,MemAct)
MemAct 将上下文的插入、删除等整理操作纳入可学习动作,用端到端 RL 优化;其 Dynamic Context Policy Optimization 针对上下文会发生变化的训练过程。
- 训练对象与信号:同时决定任务动作与上下文整理动作的策略;任务反馈。
- 最值得关注:把“保留什么”从固定外部规则变成策略决策。
- 边界:删除信息可能改变后续决策条件,训练必须匹配实际可见上下文;它不是简单地在 prompt 中要求模型少记一点。
[18] MemTrain: Self-Supervised Context Memory Training(2026)
MemTrain 尝试降低记忆训练对昂贵完整 Agent 轨迹的依赖:使用无标签文本构造记忆更新后的实体重建和中间信息回忆等代理任务,再用 GRPO 训练记忆能力,为后续记忆后训练提供初始化。
- 训练对象与信号:具备上下文记忆能力的模型;从原始文本自动构造的可检查目标。
- 最值得关注:先用便宜代理任务学习信息保留,再进入更昂贵的环境交互训练。
- 边界:这是记忆训练的相邻方向。代理任务得分提高,不等于完整网页或代码任务成功率必然提高,需要单独验证迁移。
[19] SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents(2026)
SWE-MeM 把记忆管理落到代码修复流程:先构造带主动记忆管理的 SFT 数据,再用 Memory-aware GRPO 学习什么时候压缩、保留什么、怎样压缩。
与普通长轨迹 RL 相比,压缩检查点会改变后续实际看到的前缀。训练将轨迹拆成与这些前缀对应的子轨迹,并设计掩码,避免把所有记忆错误无差别传播到整条任务。论文还按原始 rollout 聚合损失,防止切成更多片段的轨迹被意外加权。(正文 §2)
- 训练对象:执行代码任务并管理记忆的 Agent。
- 边界:运行框架本身已有明显收益,必须分别看 Workflow-only、SFT 和 SFT+RL;完整系统相对裸模型的涨分不能全算作训练收益。
3.7 训练系统:能否负担得起长轨迹的优化?
[20] SINKFLEX-RL: Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks(2026)
这项工作连接工具环境封装、GRPO 训练与 sink-aware FlexAttention,实现较低资源占用的长程工具使用训练。它补充的是系统层视角,而不是只提出新的奖励定义。
- 训练对象与信号:工具使用策略;环境任务回报。
- 阅读价值:把轨迹长度、注意力实现和训练显存一起考虑,避免算法设想停在无法运行的阶段。
- 证据边界:属于较新的、初步的系统实验;论文的长度扩展验证到 8,192 tokens,不能据此声称支持百万 token 训练。其会议说明是 COLM 2026 的 Efficient Reasoning workshop,不是主会论文。
4. 具体数值例子:HSL 怎样把失败轨迹变成训练数据?
下面沿用 HSL 正文 §3.2–3.4 的方法与损失形式,但动作、概率和超参数都是教学用简化示例,不是论文报告的某次 rollout。为便于手算,将每个动作视作一个符号;真实语言动作的 log probability 还涉及动作内部 token。
4.1 原任务失败,不代表什么都没做到
原指令是“把杯子冷却后放入橱柜”。Agent 实际执行:
| 步骤 | 已发生的动作 | 对新目标是否相关 \(z_t\) |
|---|---|---|
| 1 | 走到桌子旁 | 1 |
| 2 | 拿起杯子 | 1 |
| 3 | 查看墙上的装饰画 | 0 |
| 4 | 再次查看装饰画 | 0 |
| 5 | 走到冰箱旁 | 1 |
| 6 | 把杯子放入冰箱 | 1 |
随后交互预算耗尽,原任务没有完成。重标注器检查真实观察,提出已经完成的新指令:“把杯子放入冰箱。”
这时新示范 \(d_1\) 包含六步历史,相关标签为 \([1,1,0,0,1,1]\)。不能仅凭语言解释宣称完成;环境状态必须支持杯子已经位于冰箱中。无关动作保留在历史中,但其直接监督损失被掩掉,避免把“看画”教成实现新目标必须执行的动作。
4.2 不让最简单的重标目标占满训练数据
HSL 用相关动作数量 \(n_d\) 作为任务难度的代理,用相关动作比例 \(n_d/T_d\) 近似表示执行效率。其采样权重为:
\[ w_d=\left(\frac{n_d}{T_d}\right)^\alpha n_d, \qquad P(d)=\frac{w_d}{\sum_{d'}w_{d'}}. \]
本例取 \(\alpha=1\)。对 \(d_1\),\(T_1=6,n_1=4\),所以:
\[ w_1=\frac46\times4=\frac83. \]
再设重标缓冲区只有另一条示范 \(d_2\),总共四步,其中两步相关,则:
\[ w_2=\frac24\times2=1, \qquad P(d_1)=\frac8{11}, \qquad P(d_2)=\frac3{11}. \]
这不是证明四个相关动作一定比两个更难,而是论文使用的可计算启发式;该近似失效也是潜在风险。
4.3 掩码怎样进入 SFT 损失?
记 \(I'\) 为重标指令,\(h_t\) 为执行动作前的历史和当前观察。单条重标示范的损失为:
\[ \ell(d)=-\frac1{T_d}\sum_{t=1}^{T_d} z_t\log\pi_\theta(a_t\mid h_t,I'). \]
注意分母沿用论文式 (3) 的总动作数 \(T_d\),不是相关动作数 \(n_d\)。假设 \(d_1\) 四个相关动作的预测概率依次为 \(0.5,0.5,0.25,0.5\),则:
\[ \ell(d_1) =-\frac{\log0.5+\log0.5+\log0.25+\log0.5}{6} =\frac{3.465736}{6}\approx0.577623. \]
两次看画对应的直接损失为零。设 \(d_2\) 两个相关动作概率都为 \(0.5\),则:
\[ \ell(d_2)=-\frac{2\log0.5}{4}\approx0.346574. \]
按重加权分布计算重标数据的期望损失:
\[ \mathcal L_{\mathrm{relabel}} =\frac8{11}\times0.577623+\frac3{11}\times0.346574 \approx0.514609. \]
最后与原始专家示范损失混合。教学上设 \(\lambda=0.5\),当前专家损失为 \(0.4\):
\[ \mathcal L_{\mathrm{HSL}} =\lambda\mathcal L_{\mathrm{relabel}} +(1-\lambda)\mathcal L_{\mathrm{expert}} \approx0.457305. \]
优化器再执行 \(\theta\leftarrow\theta-\eta\nabla_\theta\mathcal L_{\mathrm{HSL}}\)。这个例子已展示从失败输入到可优化标量的完整路径;具体参数变化还需要真实模型的 Jacobian 和优化器状态,不能只凭几个动作概率算出。
4.4 这一更新实际教会模型什么?
它提高的是模型在新指令“把杯子放入冰箱”条件下,采取相关行动的倾向;并没有把原任务“冷却后放入橱柜”标成成功。经过多轮采样与训练,模型可能利用这些较短、已掌握的行为去解决原来更难的目标,但这种迁移需要实验验证。
推理时使用训练后的 Agent,不需要每次都调用事后重标注器;成本主要发生在数据构造和训练阶段。HSL 的核心价值,是提高已付出环境交互成本的轨迹的可利用程度。(原文图 2、§3.2–3.4)
5. 实验结果:四组数字,四种不同的证据
下面只在各论文自身的设置内比较,不做跨数据集、跨模型的统一排行榜。成功率的差值用百分点表示。
5.1 BEACON:局部进展可以转化为明显的训练收益
原文表 1,Qwen2.5-1.5B-Instruct,ALFWorld 的 Long 子集:
| 方法 | 成功率 |
|---|---|
| GRPO | 53.5% |
| GiGPO | 79.5% |
| BEACON | 92.9% |
BEACON 相对 GRPO 为 +39.4 个百分点,相对 GiGPO 为 +13.4 个百分点。这支持里程碑与双尺度信用分配在该设置中的价值,但不能推出所有网页和代码工作流都能获得相同涨幅。来源:BEACON 表 1。
5.2 Horizon Length:减少跨度有效,但必须说明动作预算
Qwen3-1.7B 在目标距离 21–30 的数独上训练,测试距离 26–30 时,宏动作 RL 的平均成功率为 69.50%,原子动作 RL 在崩溃前为 8.75%,差值 60.75 个百分点。
这里比较的不只是更新公式:宏动作改变了接口,回复长度上限也从原子动作设置的 2,048 提高到 4,096 tokens。它是有效训练方案的证据,不是严格相同 token 预算下的纯算法对照。来源:Horizon Length 附录表 7 与训练配置。
5.3 SWE-MeM:拆开 Workflow-only、SFT 与 RL
原文表 1,SWE-bench Verified,Qwen3-Coder-30B-A3B,32k 上下文设置:
| 设置 | Resolve Rate |
|---|---|
| OpenHands 基础 Agent | 38.6% |
| SWE-MeM Workflow-only | 58.4% |
| SWE-MeM SFT | 58.8% |
| SWE-MeM SFT+RL | 60.2% |
完整方案比基础 Agent 高 21.6 个百分点;但相对已经使用该工作流、尚未训练的版本,训练的增量是 1.8 个百分点。RL 相对 SFT 的增量是 1.4 个百分点。因此“RL 带来 21.6 个点”是错误归因。
4B 模型的 SFT 与 SFT+RL 分别为 41.6% 和 43.4%,也说明讨论训练收益时应固定模型和工作流,再比较相邻阶段。来源:SWE-MeM 表 1。
5.4 MEM1:“3.5 倍”不是整项长任务成功率
原文表 1 的 16-objective QA 设置中,MEM1-QA(7B)的 EM count 为 1.97,Qwen2.5-14B-Instruct 为 0.567,比值约 3.47 倍。EM count 是平均精确答对的子问题数量,不是百分比,更不是“16 个子问题全部完成”的成功率。
同一设置的峰值 token 数列以 \(10^2\) 为单位,分别为 10.4 和 38.4,对应约 1,040 与 3,840 tokens。它体现了压缩记忆的效率潜力,但 1.97/16 的答对数量也提醒我们:相对提升很大,不代表绝对能力已经足够。来源:MEM1 表 1 与指标定义。
6. 最值得记住的创新:改变学习单位
以下是对这些工作的综合判断,不是某一篇论文声称的统一理论。
第一,从完整成功轨迹变成局部可利用证据。HSL 改写已完成目标,BEACON 保留片段进展,GiGPO / HGPO 改变比较组。共同点是减少“整条失败,所以整条都没用”的浪费,但三者修改的是不同环节。
第二,从逐 token 的平坦学习变成有结构的决策学习。ArCHer 分离语言动作与 token,HiMAC 分离计划和执行,宏动作研究直接改变一次决策的工作量。结构不是装饰,它决定策略究竟对哪个时间尺度负责。
第三,把上下文管理本身纳入可学习行为。MEM1、MemAct 和 SWE-MeM 不满足于加一个固定摘要器,而是让记忆选择与最终任务表现发生联系。这里最容易被忽视的技术点,是训练必须看到与 rollout 相同的上下文,否则优化的就不是实际执行的策略。
7. 不足与可能的改进
7.1 先保留论文已经显露的证据边界
Horizon Length 的正文及附录表明,更长同类任务上的进步没有自动带来新技巧泛化。HSL 的理论与方法需要重标示范覆盖有效目标空间,并与原始专家示范混合;它没有消除监督资源需求。SINKFLEX-RL 报告的是初步系统结果。这些边界不应被统一的“解决 long-horizon”标题抹掉。
其余论文也不能只凭最高分判断成熟度。本文没有逐篇审计训练数据污染、所有随机种子和代码复现情况,因此不对整份清单作“已充分复现”的保证。
7.2 我的分析:四个更值得做的改进实验
| 具体局限 | 可尝试的改进 | 新成本或风险 | 怎样验证 |
|---|---|---|---|
| 模型生成的子目标或重标目标可能与环境事实不符 | 在 HSL / milestone 训练中加入状态断言、单元测试或可执行验证 | 验证器开发昂贵;严格验证可能漏掉有效路径 | 测重标精度、假阳性率,以及等交互预算下的最终成功率 |
| 宏动作或不同工作流让“相同步数”不可比 | 同时报告环境轮数、生成 token、工具费用、训练 GPU 时和成功率 | 对照更昂贵,必须统一任务与预算 | 绘制成本—成功率曲线,比较等预算结果 |
| 记忆代理任务可能偏离真实长任务 | 先用 MemTrain 类任务初始化,再用有延迟依赖的真实任务训练 | 可能遗忘通用记忆能力,训练周期增加 | 单独测试关键事实保留率、删除后恢复能力、长任务成功率 |
| 课程可能只让模型记住常见子任务组合 | 按目标组合、环境布局和工具变化划分未见测试集 | 测试构造难,成功率可能显著下降 | 分开报告步数外推、组合泛化和新技能泛化 |
这些是有待实验验证的建议,不是已经在上述论文中得到证明的结论。
8. 怎么选型,怎么读?
如果已经有一个能运行的 Agent,可以从当前主要失败模式开始:
- 成功示范少,但有大量失败轨迹:先读 HSL,再比较 Agent-R 和 STeCa;先确认是否能可靠识别已经完成的目标或纠正路径。
- 短任务能做,任务变长后训练崩溃:先读 Horizon Length,再看 BEACON;检查动作单位、回报传播距离和终局奖励密度。
- 同一目标下,轨迹很多但信用很粗:先读 GiGPO / HGPO;若有可靠里程碑或过程验证器,再看 BEACON / VPR。
- 经常偏离计划:比较 ArCHer 与 HiMAC,先明确要分离的是 token 与语言动作,还是规划与执行。
- 代码或检索任务被长历史拖垮:从 MEM1 理解记忆训练一致性,再看 MemAct、SWE-MeM;低成本初始化可参考 MemTrain。
- 还没有足够的工具与状态转移能力:先看 Agentic CPT 和 OPD 研究,不要直接把长任务失败全部交给终局 RL。
若只选六篇入门,我的顺序是:Horizon Length → HSL → GiGPO → BEACON → MEM1 → SWE-MeM。这条路径依次覆盖问题诊断、数据利用、局部比较、结构化奖励、通用记忆和真实代码应用;再按兴趣补上 HiMAC 与 WebRL。
一项需要明确排除的工作
检索中经常会遇到 KLong: Training LLM Agent for Extremely Long-horizon Tasks。截至本文核对日期,其 arXiv v3 已明确标为撤稿,原因是投稿后发现的数据错误影响结果有效性。因此本文不将其计入 20 篇主清单,也不使用其性能数字作证据。来源:arXiv 撤稿状态及作者说明。
9. 小结
训练 long-horizon Agent,首先要回答的不是“是否换一个更强的 RL 算法”,而是三个更具体的问题:
- 哪里还有可学习的信号?成功示范、失败后的已达目标、可验证子目标,还是教师指导?
- 模型应该在什么粒度上负责?token、动作、子目标、记忆更新,还是整条任务?
- 实验是否隔离了训练贡献?必须把模型、工作流、上下文预算、环境交互成本和评价指标分开。
把这三个问题说明白,论文之间的关系就比一个按发布日期排序的链接列表清楚得多。
相关阅读:2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题;本文进一步将其中更宽泛的 Agent 讨论收敛到确实包含参数训练的方法。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。