从静态大模型到终身智能体:LLM 持续学习与持续强化学习的主流范式

写在前面

今天的大语言模型大多仍然是“训练一次、部署一段时间、再离线升级一次”的静态系统。它们可以在上下文中临时适应新任务,也可以通过搜索、RAG 和工具调用获取新信息,但一旦会话结束,这些经验通常不会自动沉淀为以后可复用的能力。

持续学习(Continual Learning, CL)试图改变这一点:让模型面对持续到来的知识、任务、偏好和环境变化时,既能学会新东西,又不轻易遗忘旧能力。持续强化学习(Continual Reinforcement Learning, CRL)进一步要求智能体在长期交互中不断调整行为,利用过去经验加速未来学习,并在任务边界不清晰、反馈延迟甚至奖励目标变化时仍然保持有效。

这两个方向正在 Agent 研究中汇合。LLM 提供语言、推理和知识先验;强化学习提供行动、反馈和长期优化的闭环;外部记忆、技能库、世界模型和自动课程则把一次次交互连接成“成长史”。

本文的核心判断是:近期最可行的终身智能体不会依赖单一算法,而会采用多时间尺度的混合系统——用外部记忆完成快速适应,用回放与参数高效微调完成中期吸收,再通过周期性预训练或强化学习做慢速巩固。

1. 什么才算持续学习

假设模型依次接触数据或任务流:

\[ \mathcal D_1,\mathcal D_2,\ldots,\mathcal D_T. \]

在第 \(t\) 阶段,系统主要能访问当前数据 \(\mathcal D_t\) 和有限的历史摘要、回放样本或参数状态,而不能每次都把全部历史数据重新训练一遍。它至少要同时满足三个目标:

  1. 稳定性(stability):学习新任务后,旧任务性能不要显著下降;
  2. 可塑性(plasticity):模型仍能快速吸收新知识和新技能,而不是被旧知识“锁死”;
  3. 可扩展性(scalability):训练成本、存储、参数量和推理延迟不能随任务数量无限增长。

2025 年的 CRL 综述把这三者概括为一个三角平衡,并指出 RL 中还会额外出现策略导致的数据分布变化、延迟奖励、部分可观测和任务边界未知等问题(Pan et al., 2025)。

因此,持续学习不等于“继续训练”,也不等于“模型能回答最新新闻”。如果模型学会新知识后忘记原有指令遵循能力,或者每增加一个任务就复制一整套模型,它都还没有真正解决持续学习问题。

1.1 与几个相邻概念的区别

范式 主要解决什么 是否更新参数 典型局限
RAG / 搜索 在推理时补充外部事实 检索错误、时间冲突、上下文成本
模型编辑 局部修改一个或少量事实 通常是 多次编辑可能互相干扰,难覆盖技能与价值观
微调 针对一个数据集提升能力 顺序微调容易灾难性遗忘
多任务学习 同时学习一组已知任务 默认任务集合固定,不强调时间顺序
元学习 学会更快地学习新任务 不一定要求长期保留全部旧任务
持续学习 在非平稳任务流中积累能力 可选 必须同时评估保留、迁移与资源开销

Wu et al. 的 LLM 持续学习综述也把 RAG 和模型编辑视为相邻但不同的知识扩展方法:它们非常重要,却不能单独替代持续学习。2026 年的真实知识漂移研究进一步发现,普通 RAG、持续微调和若干知识更新方法在时间演化事件上都会遇到时间不一致或遗忘,说明“把最新文档检索进来”并没有自动解决持续适应(Liu et al., 2026)。

2. 大语言模型持续学习的三条主线

LLM 的训练天然分为多个阶段,因此一个实用的分类方式是:持续预训练、持续指令微调和持续对齐。这也是近年两篇主要综述采用的核心框架(Wu et al., 2024Shi et al., 2025)。

2.1 持续预训练:更新事实、领域与语言

持续预训练(Continual Pre-Training, CPT)让模型按时间或领域顺序接触新的无标注语料,目标包括:

  • 更新不断变化的世界知识;
  • 进入金融、医疗、法律、代码等新领域;
  • 扩展新语言或新的表达分布;
  • 保留原有通用语言与推理能力。

代表性工作包括面向时间演化语料的 Lifelong Pretraining,以及不断加入领域语料的 Continual Post-Training(Jin et al., 2022Ke et al., 2022)。

CPT 的核心难点不仅是旧知识遗忘,还包括:

  • 知识覆盖:新语料只覆盖了少量事实,却可能改变大量参数;
  • 时间冲突:旧事实可能是“当时正确”,不应简单删除;
  • 跨阶段遗忘:一个已完成指令微调和安全对齐的模型重新做预训练后,可能退化为不听指令或更不安全的模型;
  • 数据配比:新数据、通用数据与历史回放数据的比例直接决定稳定性与可塑性。

2026 年一项覆盖 200 多个模型、最高 100B token 的系统实验表明,按难度组织预训练数据的课程学习在训练早中期可减少约 18%–45% 达到基线性能所需的训练步数,但收益依赖课程度量、数据规模与是否交错采样(Zhang et al., 2026)。这说明“学什么、以什么顺序学”正逐渐成为与优化器同样重要的问题。

2.2 持续指令微调:不断增加任务、领域与工具

持续指令微调(Continual Instruction Tuning, CIT)让模型依次学习新的指令任务。常见场景有:

  • 任务增量:摘要、抽取、推理、代码等任务依次到来;
  • 领域增量:通用助手逐步进入医疗、金融、科研等领域;
  • 工具增量:模型需要不断学习新的 API、软件和机器人技能。

这一阶段的主流方法可以归纳为四类。

A. 回放与数据混合

保留少量历史样本,在训练新任务时一起重放,是最简单也最强的基线之一。InsCL 根据指令相似性和指令信息量选择回放数据,在 16 个顺序任务上优于随机回放和不回放(Wang et al., NAACL 2024)。

优势是方法直接、与现有训练栈兼容;代价是需要保存数据,并处理隐私、版权、样本选择和回放缓冲区增长问题。若不能存储原数据,可以用旧模型生成伪样本,即生成式回放,但伪样本错误也会被反复放大。

B. 正则化、蒸馏与梯度约束

这类方法限制新训练对重要参数或旧输出分布的破坏。经典 EWC 使用 Fisher 信息估计参数对旧任务的重要程度,对关键参数的变化施加更强惩罚(Kirkpatrick et al., 2017)。知识蒸馏则要求新模型在历史输入上接近旧模型输出。

它们不一定需要保存全部旧数据,但连续任务越来越多时,约束可能不断累积,导致模型失去可塑性。换言之,防止遗忘过强,也会变成“防止学习”。

C. 参数隔离与参数高效微调

冻结主干模型,为每个任务学习 prompt、adapter 或 LoRA,是 LLM 场景中很自然的路线。典型做法包括:

  • 为任务维护独立的软提示或 adapter;
  • 用路由器按输入选择专家;
  • 让新 LoRA 在与旧任务近似正交的子空间中学习;
  • 扩展少量 Transformer block,再周期性合并或压缩。

这类方法能显著降低训练成本并减少直接干扰。问题是 adapter、路由和任务标识会随时间膨胀;任务边界未知时,系统还要先判断“当前属于哪个任务”。

D. 外部知识与模块化记忆

与其让所有新知识进入参数,不如把事实、经验和工具说明存入可检索记忆,只把稳定、频繁、可泛化的模式逐步蒸馏进模型。这条路线介于 RAG、持续学习和模块化模型之间,也是现实系统最常见的工程选择。

它的关键问题从“如何训练”转向“写入什么、何时合并、何时遗忘、怎样检索”。如果记忆策略是固定规则,系统很容易存下大量噪声;如果让模型自己决定,又会引入错误记忆、自我强化和隐私风险。

2.3 持续对齐:偏好和价值也会变化

持续对齐(Continual Alignment)研究模型如何依次吸收新的价值约束、人群偏好和个性化反馈,同时保留已有的安全与帮助性。

普通 RLHF、DPO 或 GRPO 通常假设训练数据、奖励模型和优化目标在一次训练中相对固定。持续对齐则要处理:

  • 不同群体的偏好并不一致;
  • 同一个用户的偏好会随时间变化;
  • 新领域需要新的安全规则;
  • 奖励模型本身也会漂移或被策略利用;
  • 新一轮指令微调可能破坏之前的安全对齐。

早期方法如 CPPO 和 COPF,分别通过旧策略约束、样本加权或序列最优策略正则化,把 PPO/DPO 扩展到连续偏好任务。该方向仍缺少统一、长期、跨群体的标准评测。2025 年的“从奖励中学习”综述也明确把 continual learning from rewards 视为构建长期胜任且持续对齐智能体的重要前沿,并指出固定数据、固定奖励和短 episode 假设与真实世界长期交互并不匹配(Wu, 2025)。

3. 持续强化学习:让智能体永远不停止学习

传统 RL 往往把学习理解为:在一个固定 MDP 中找到高回报策略。持续 RL 更强调“学习本身没有终点”。Abel et al.(NeurIPS 2023)给出的定义甚至把持续智能体描述为一个可以无限进行隐式搜索的系统;多任务 RL 和持续监督学习都可以视为这个更一般定义的特殊情况。

3.1 四种常见场景

  1. 终身适应:任务持续到来,系统希望越来越快学会相关任务;
  2. 非平稳学习:状态转移、观测、奖励或对手随时间变化;
  3. 任务增量学习:明确知道任务切换和任务 ID;
  4. 任务无关学习:没有任务标签,智能体必须自己发现环境发生了变化。

第四种最接近真实部署,也最困难。一个个人助手不会收到“任务 17 已结束,任务 18 开始”的通知;它只会看到用户习惯、软件界面和外部世界逐渐变化。

3.2 按知识载体划分的四类主流方法

2025 年 CRL 综述从“系统在保存和迁移什么知识”出发,把方法分为四类(Pan et al., 2025):

知识载体 主要方法 解决的问题 典型风险
策略 策略复用、模块分解、蒸馏、参数合并 保留并组合已学行为 策略库膨胀、负迁移
经验 轨迹回放、优先回放、生成式回放 用旧经验稳定学习 存储成本、旧数据过时
动力学 世界模型、上下文推断、任务模型 识别环境变化并规划 模型偏差累积
奖励 奖励塑形、内在动机、奖励机器 在反馈稀疏或变化时继续探索 奖励投机、目标漂移

策略聚合:从 EWC 到 Progress & Compress

策略层方法可以保护重要权重、为新任务增加模块,或把新策略蒸馏回共享知识库。Progress & Compress 使用“活动列”学习新任务,再把知识压缩到固定容量的知识库中,在不保存全部旧任务数据的情况下循环执行学习与巩固(Schwarz et al., ICML 2018)。

这个“快速学习器 + 慢速知识库”的结构对 LLM Agent 仍然很有启发:当前会话和临时 adapter 可以是快速系统,基础模型和经过验证的技能库则是慢速系统。

经验回放:简单,但依然难以替代

CLEAR 把在线新经验和历史 replay 混合,并用行为克隆或 value 克隆保持旧策略,是持续 RL 中有代表性的经验回放方法(Rolnick et al., NeurIPS 2019)。

回放的真正难点不是“存一批轨迹”,而是决定哪些经验仍然代表当前世界。过度回放旧轨迹会阻碍适应;完全丢弃旧轨迹又会造成遗忘。长期系统因此需要带时间、环境版本、置信度和因果结果的经验管理。

世界模型:把变化显式建模

如果环境动力学发生变化,智能体可以不直接覆盖旧策略,而是先推断当前处于哪种上下文,再选择或组合对应的模型与技能。世界模型还能生成伪轨迹供回放,并支持在真实交互前进行规划。

但世界模型的错误会进入闭环:错误预测导致错误行动,错误行动又产生偏置数据。因此,持续世界模型需要不确定性估计、变化点检测,以及真实交互的周期性校准。

奖励与内在动机:决定下一步学什么

在开放环境中,仅靠固定外部奖励无法告诉智能体应该探索哪些未知能力。内在动机、信息增益、empowerment 和新颖性可以把“提升未来可控性”本身变成学习目标;奖励机器或时间逻辑则可以把长期任务分解为更可学习的结构。

4. 自动课程与开放式学习

持续学习解决“如何不忘”,自动课程学习(Automatic Curriculum Learning)进一步解决“下一步应该学什么”。二者结合后,系统不再被动等待任务流,而是主动选择最有学习价值的任务、数据和环境。

4.1 从人工课程到策略相关课程

一个好的课程不是固定的“从易到难”列表,因为同一个任务对不同阶段的策略具有不同价值。Prioritized Level Replay 用 TD error 等信号估计关卡未来的学习潜力,优先重访当前最值得学习的环境,从而自动形成随策略变化的课程(Jiang et al., ICML 2021)。

4.2 对抗式环境生成

PAIRED 把环境设计变成 protagonist、antagonist 与环境生成器之间的博弈,以 regret 而非单纯失败率选择训练环境:环境应该让较强策略能解决、当前策略仍会犯错,从而处在“恰好有挑战”的区域(Dennis et al., NeurIPS 2020)。

4.3 开放式种群学习

XLand 通过程序生成的世界、游戏和种群训练不断改变任务分布。其目标不是在固定榜单上收敛,而是让能力边界随训练代际持续向外扩展(DeepMind Open-Ended Learning Team, 2021)。这类方法揭示了持续学习的一个更激进方向:系统不仅更新策略,还更新“值得学习的问题空间”。

4.4 LLM 生成课程与技能

Voyager 把这一思想带入 LLM Agent:它在 Minecraft 中用 LLM 自动提出探索任务,把验证成功的程序存入技能库,再利用环境反馈和执行错误迭代改进代码。其三个核心组件正是自动课程、可增长技能库和反馈驱动的迭代提示(Wang et al., 2023)。

这里有一个重要变化:LLM 不只是被训练的策略,也可以是课程生成器、经验压缩器、任务分解器和奖励解释器。语言提供了比固定 task ID 更开放的目标空间,使智能体能够表达“我还不会什么”以及“下一步该练什么”。

5. LLM 持续学习与 CRL 如何汇合

LLM 的参数更新很慢,环境交互却要求快速反应。把所有经验立刻写进权重既昂贵又危险;完全不更新权重,又无法形成真正可迁移的长期能力。因此,更合理的系统是分层记忆与多时间尺度学习。

时间尺度 学习载体 典型操作 主要目标
秒到分钟 上下文 / 工作记忆 检索、规划、工具调用 完成当前任务
小时到天 情景记忆 / 技能库 反思、轨迹摘要、程序或 workflow 入库 跨 episode 复用经验
天到周 adapter / LoRA / reward model 回放、PEFT、偏好更新 吸收稳定的新领域与偏好
周到月 基础模型 / 世界模型 持续预训练、蒸馏、策略巩固 形成通用、可迁移能力

Reflexion 展示了不更新权重的“语言强化学习”:智能体把任务反馈转成文字反思,存入 episodic memory,并在下一次尝试时检索使用(Shinn et al., NeurIPS 2023)。这类方法适合快速适应,但记忆会增长、冲突和过时,因此最终仍需要压缩、验证和巩固。

一个完整闭环可以写成:

\[ \text{观察} \rightarrow \text{检索记忆} \rightarrow \text{规划与行动} \rightarrow \text{环境反馈} \rightarrow \text{评价与归因} \rightarrow \text{更新记忆/技能} \rightarrow \text{选择下一课程} \rightarrow \text{周期性参数巩固}. \]

这比“每次成功轨迹都拿去做 SFT/RL”更稳健,因为它允许系统先在外部记忆中积累证据,只把多次验证、跨情境有效的经验写入长期参数。

6. 一个可落地的终身 Agent 架构

如果今天要实现一个能够长期成长的 LLM Agent,我会采用以下七个模块。

6.1 事件流与版本化状态

每次交互保存:环境版本、用户/任务上下文、观察、动作、工具结果、最终结果、奖励来源和模型版本。没有版本信息,系统无法区分“策略变差了”与“环境规则变了”。

6.2 分层记忆

  • 工作记忆:当前任务上下文;
  • 情景记忆:具体成功或失败轨迹;
  • 语义记忆:从多条轨迹抽象出的事实和规律;
  • 程序性记忆:经过验证的工具调用、代码和技能;
  • 偏好记忆:用户或群体偏好,带时间与适用范围。

每条记忆至少需要来源、时间、置信度、适用条件和失效条件,而不只是一个 embedding。

6.3 评价器与奖励系统

奖励可以来自用户、单元测试、环境成功信号、规则、LLM judge 或世界模型预测。关键是保留奖励来源,并尽可能使用可验证信号。生成器和评价器不应永远是同一个模型,否则容易形成自我确认和 reward hacking。

6.4 经验选择与回放

回放缓冲区不应只按“成功/失败”采样,还应考虑:

  • 新颖性与覆盖度;
  • 对当前策略的学习价值;
  • 是否代表能力退化;
  • 环境是否已经过时;
  • 隐私与许可;
  • 反事实验证的置信度。

6.5 课程调度器

课程调度器根据当前能力缺口选择下一批任务。一个实用目标可以同时包含:预期学习进步、遗忘风险、探索价值、真实需求和训练成本,而不是单纯最大化题目难度。

6.6 多级学习器

  • 先尝试只更新外部记忆;
  • 高频、稳定模式进入 adapter 或 LoRA;
  • 跨任务通用能力再蒸馏到基础模型;
  • 偏好和策略更新加入旧策略 KL、历史回放与安全回归测试;
  • 当环境动力学变化时,优先更新上下文模型或世界模型,而不是盲目覆盖策略。

6.7 安全门与回滚

持续学习意味着模型行为会在部署后变化,因此必须保留:

  • 训练数据和奖励的审计记录;
  • 每次模型、adapter、记忆库和技能库的版本;
  • 旧能力、安全性和隐私回归测试;
  • 灰度发布、快速回滚和冻结学习的开关。

没有这些机制,“持续学习”很容易退化为不可复现的线上自我修改。

7. 应该怎样评估

只看最后一个任务的准确率会奖励“学新忘旧”。一个合理评测矩阵记作 \(p_{i,j}\):模型学完第 \(i\) 个任务后,在第 \(j\) 个任务上的表现。

常用指标包括:

  • 平均性能:当前在所有已见任务上的平均表现;
  • 遗忘量:某旧任务历史最好成绩与当前成绩之差;
  • 前向迁移(FWT):旧知识是否让新任务学得更快;
  • 后向迁移(BWT):学习新任务是否反而改善旧任务;
  • 适应速度:达到目标回报需要多少交互;
  • 资源增长:参数、内存、回放数据和训练计算量怎样随时间变化;
  • 时间一致性:面对不同时点的事实,能否给出与时间条件一致的答案;
  • 安全保持:新训练是否破坏拒答、隐私和权限边界。

LLM 侧可参考 TemporalWiki、CITB、TRACE 以及 2026 年的真实知识漂移评测;CRL 侧常用 Continual World、CORA 和 COOM。Continual World 特别强调不要只关注遗忘,还要关注 forward transfer(Wołczyk et al., NeurIPS 2021)。

一个严谨实验还应包含:

  1. 不同任务顺序;
  2. 明确任务边界与隐藏任务边界两种设置;
  3. 与 joint training、naive fine-tuning、只用 RAG 和独立模型上界比较;
  4. 固定存储和计算预算;
  5. 多次随机种子与长期重复评测;
  6. 对奖励投机、错误记忆和环境漂移的压力测试。

8. 仍然开放的研究问题

8.1 什么应该进入权重,什么应该留在外部记忆

事实更新适合检索,稳定技能可能适合参数化,但边界并不固定。未来系统需要学习一个“巩固策略”:根据复用频率、稳定性、可验证性和隐私成本决定经验的去向。

8.2 如何发现任务变化,而不是依赖 task ID

真实环境很少提供清晰边界。Agent 需要通过预测误差、奖励分布、工具返回和用户行为识别变化点,并判断这是新任务、旧任务的新版本,还是短期噪声。

8.3 如何让奖励也持续学习而不漂移

策略在变化,评价标准也在变化。一个旧 reward model 可能无法评价新能力;一个不断在线更新的 reward model 又可能被策略带偏。需要动态奖励建模、独立验证器、时间条件化偏好和可审计的奖励版本。

8.4 如何把大量轨迹压缩为可迁移的技能

单条成功经验往往依赖偶然上下文。真正有价值的是跨任务反复出现、经过反事实验证的步骤模式、子目标和技能。把轨迹归纳为 motif,再用少量分叉 rollout 验证其因果贡献,是连接长期记忆、步骤级信用分配与技能库的一条值得探索的路线。

8.5 如何避免“会得越多,维护越贵”

独立 adapter、策略和技能库可以避免遗忘,却会持续增长。终身系统需要合并相似技能、淘汰过时知识、压缩专家,并证明资源增速慢于能力增速。

8.6 如何定义真正开放式的进步

固定 benchmark 终有饱和的一天。开放式学习要求任务生成器、评价器和策略共同演化,但这也会带来评价失真:系统可能只生成自己擅长的问题。如何保留外部锚点、真实需求和人类可审计性,是自动课程走向开放世界的关键。

9. 我的总结

LLM 持续学习与持续强化学习正在形成一条共同路线:

  1. 从一次性训练转向长期数据与任务流;
  2. 从只防止遗忘转向稳定性、可塑性与可扩展性的共同优化;
  3. 从单一参数记忆转向上下文、外部记忆、技能库、adapter 和基础模型的分层存储;
  4. 从固定奖励转向可验证、可更新、带来源的反馈系统;
  5. 从被动接收任务转向自动课程、自我生成目标与开放式探索;
  6. 从模型能力转向完整 Agent 的感知—行动—反馈—反思—巩固闭环。

在我看来,未来几年最重要的分界线不会是“模型有没有长期记忆”,而是:

它能否把长期经验转化为经过验证、可迁移、可回滚的新能力,同时知道哪些旧知识该保留、哪些应该更新、哪些必须遗忘。

做到这一点,静态大模型才真正开始走向终身智能体。

延伸阅读

综述与定义

代表方法与系统


从静态大模型到终身智能体:LLM 持续学习与持续强化学习的主流范式
https://kissshhot.github.io/2026/09/01/llm-continual-learning-and-continual-rl/
作者
丁一帆
发布于
2026年9月1日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。