从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述

持续预训练如何改变模型的知识、能力与后训练起点?本文沿着数据、优化与评估三条线,整理 12 篇论文与技术报告,梳理从领域适配到 Hephaestus、AgentFounder 和 SPT 的研究脉络。

检索截至 2026 年 9 月 8 日。文中区分论文结果、研究判断与教学示例,附一手来源链接。

关于 FAS、HAS 与训练流程的更详细分析,可继续阅读本站的 AgentFounder 精读

CPT 改变了什么?

大语言模型学会回答问题之后,为什么还要回到预训练?因为后训练所能调用的知识、行为模式和探索起点,受到基础模型的影响。传统 CPT 研究如何以较小代价吸收新数据;Agentic CPT 则进一步研究,能否在后训练之前,就让模型接触规划、工具调用和环境反馈。 [3] [8] [9]

本文的判断:Agentic CPT 的价值在于改善后训练的起点。评估它时,既要看最终任务表现,也要问:同样的后训练预算,是否能得到更好的智能体?

CPT 通常指从已有权重继续进行预训练。Continued 更常描述一个续训阶段,Continual 更强调多次或连续更新,但文献中用法并不统一。DAPT 是面向领域的适配,TAPT 是面向任务无标签数据的适配;mid-training 则更多描述训练阶段的位置,不能仅凭这个名称判断数据和损失函数。 [1] [3] [11]

范式 主要学习材料与信号 需要分清的边界
传统 CPT 新领域、语言或时间段的文本;语言建模损失 可以是一次离线续训,不必是终身学习
Agentic CPT 工具文档、规划、轨迹、反馈、技能包;通常仍用语言建模目标 学习行动先验,不自动意味着真实交互或在线更新
SFT 指令与示范;常对回答部分计算监督损失 和 CPT 都可能用交叉熵,区别不能只看公式
Agentic RL 与环境交互后获得奖励,优化策略 训练信号和采样过程不同于离线文本预测
RAG / 外部记忆 推理时检索文档或历史经验 通常不更新基础模型参数,可与 CPT 组合

上表是本文采用的工作定义。真实系统可能混用数据与损失掩码,应以论文的训练实现为准。

通用预训练 → Agentic CPT → SFT → RL

分别学习语言与知识、行动相关材料、任务示范,以及交互结果优化。

这是代表性流程示意,不要求每项研究都包含全部阶段。Tongyi DeepResearch 的报告明确采用这条训练链路。 [12]

对自回归模型,可以用一个统一写法理解文本学习:

1
2
3
4
5
L(θ) = − E[x ~ D] Σₜ mₜ log pθ(xₜ | x₍<t₎)

D:训练样本的分布
mₜ:token 权重或损失掩码
θ:需要更新的模型参数

这个公式本身并不保证智能体能力。决定模型学到什么的关键,还包括训练序列如何表达“观察—判断—行动”、哪些 token 被监督、失败是否被标记,以及模型接触过多少不同环境。下面沿这条线索梳理研究。

传统 CPT:从领域适配到可学习的数据

第一条线:新领域值得继续学,但“学进去”不等于“用得出”

Don’t Stop Pretraining 在四个领域、八个分类任务中验证了 DAPT 和 TAPT 的价值。它确立的是“通用预训练后仍有适配空间”这一研究起点,而不是关于现代聊天模型的直接结论。 [1]

到了生成式 LLM,AdaptLLM 发现,直接学习领域原始文本可能改善知识吸收,却损害问答提示能力;将文本改造成阅读理解材料,可以缩小这种差距。Instruction Pre-Training 则用指令合成器把原始语料扩展为大量任务—回答样本,说明指令结构也可以更早进入训练。 [4] [5]

由此得到的设计启发:领域语料的“专业程度”与训练样本的“可学习程度”不是同一个维度。读完一本 API 手册后,模型是否能在真实任务中选对参数,需要另行验证。

第二条线:续训要同时处理适应、遗忘与优化状态

How to (re)warm your model? 在 Pythia 410M 上发现,重新提高学习率会带来短期损失上升,但能改善较长训练后的新分布表现。后续 Simple and Scalable Strategies 将重新升温、再次衰减和旧数据回放结合起来,在其测试范围内接近从头重训的效果;其中 10B 实验验证的是较弱分布变化,不能外推为所有迁移情形。 [2] [3]

MoE 还涉及专家路由与负载分配。How robust is your router? 在所研究的模型和路由方式下观察到较强鲁棒性,并保留了相对 FLOP 匹配稠密模型的样本效率。这为 MoE 续训提供依据,但不是对任意路由器、任意领域偏移的保证。 [7]

实践中应把“新数据学得更快”和“旧能力掉得更少”画成两条曲线。只监控新领域训练损失,很容易把过拟合当成适配成功;只用结束时的一个综合分数,也可能掩盖训练过程中的回退。

第三条线:小语料瓶颈可以通过重组知识缓解

EntiGraph 从小规模文档中提取实体,再围绕实体关联生成多样化文本,用这些合成数据续训。它强调的是增加知识出现的角度与联系,而非机械重复原文;论文还发现,参数中的知识可以与推理时的检索结合。 [6]

这条线索对 Agentic CPT 很有启发:如果静态知识可以改写成学习材料,操作手册也可以改写成计划、工具选择和故障恢复练习。不过,合成过程必须保留事实与反馈的来源;“模型写得像真的”不能替代执行验证。

Agentic CPT:让行动相关知识提前进入模型

Hephaestus:先把工具世界整理成语料

2025 年 2 月的 Hephaestus 是这条路线的直接代表。Hephaestus-Forge 包含约 103B agent 专用 token,覆盖 76,537 个 API,结合工具文档与调用轨迹。研究还利用小模型探索数据配比:在其设置下,agent 数据约占 36% 较优,接近 agent、通用文本、代码 1∶1∶1;随后进行两阶段 CPT 与指令微调。 [8]

值得借鉴的是“文档知识+行为材料+通用回放”的组合。这里的 36% 是特定数据、模型和评估条件下的结果,不能直接当作所有 agent 模型的默认超参数。103B 指语料规模,也不等于完整训练总 token 数。

AgentFounder:把静态知识与已有轨迹改造成决策材料

Scaling Agents via Continual Pre-training 将 Agentic CPT 显式放在基础预训练与后训练之间。其两类数据构造分别是:FAS 从知识构造问题、规划与首步行动;HAS 在已有轨迹的步骤上扩展候选行动,再组织选择、原始反馈及结果判断。新增候选的合成不需要实际调用外部工具。 [9]

论文采用 32K 到 128K 的两阶段上下文训练。数据规模实验从 0 到 315B token,多个 agent 基准的平均 Pass@3 从 54.2% 到 62.2%,即提高 8.0 个百分点。这是论文特定评估协议下的结果,不能换写成单次成功率,也不能认为每个基准都提升了 8 个点。 [9]

需要保留的区别:候选行动有多个,不代表每个候选都获得了真实执行反馈。离线扩展行动空间,可以增加学习材料的多样性;它是否带来对未见工具的可靠探索,仍需交互实验。

阅读这篇论文时,更有价值的问题是:性能提升来自哪些数据、上下文长度和后训练设置?不要把“第一篇”的叙述扩大为整个领域的起源;Hephaestus 更早研究了通过 CPT 增强 agent 能力。 [8] [9]

SPT:技能包成为第三类训练材料

2026 年 8 月的 SPT 将技能包用于中期语言建模训练。它用 Reference Insert 把支持文件放在主说明中引用它们的位置附近,尽量保留跨文件关系。主实验对比普通语料、AgentBank 轨迹和 SkillCorpus,统一中期训练预算为 347,770,880 token,并使用相同后训练配方。 [11]

在 OLMo-3-1025-7B+xLAM-FC 设置中,四项 agent 评估的未加权均值为:不做中期训练 28.50,轨迹数据 44.05,技能数据 53.46。最后两个条件之差是 9.41 个百分点。这组对照支持技能材料的价值;它仍属于特定模型与评测下的预印本结果,不能推出技能包普遍优于执行轨迹。 [11]

本文认为,它揭示了三种互补的学习材料:文档解释“工具是什么”,轨迹展示“任务怎么做过”,技能包表达“某类任务可以怎样做”。技能包中的流程和依赖关系,可能比孤立调用记录更容易复用;这是值得继续验证的假设。

代表方向 数据组织方式 优先检验的问题
Hephaestus API 文档+调用轨迹+通用文本与代码 覆盖度、配比与通用能力保留
AgentFounder 知识→问题/行动;轨迹→多选项决策文本 离线合成是否改善真实长程决策
SPT 主技能说明+被引用的脚本、模板与参考文件 跨文件组织是否带来未见工作流迁移

表格综合自 [8]、[9]、[11];最后一列为本文提出的评估重点。

什么证据,才说明 CPT 真有用?

训练 loss 下降说明模型更善于预测训练分布,并不充分说明它更能完成任务。最终系统分数又混合了 CPT、SFT、RL、工具、提示词和推理预算的影响。因此,需要分层看证据。

评估层 要回答的问题 建议记录
基础模型 CPT 后是否形成了行动相关知识与偏好? 留出集损失、工具语义、规划与行动选择
相同后训练 给定同样的 SFT/RL,CPT 是否改善起点? 相同数据、训练步数下的任务分数与学习曲线
端到端系统 真实执行是否可靠,成本是否合理? 任务成功率、调用次数、延迟、失败类型
迁移与保留 收益是否超过训练场景,旧能力是否退化? 未见 API/网站/任务、通用能力与旧任务回归

APTBench 正是为第一层设计的:把真实任务与成功轨迹改造成适合 base 模型的选择或补全问题,覆盖软件工程与深度研究中的规划和行动。论文报告它能提供较有预测力的下游 agent 信号。它适合用于训练中筛选检查点;替代真实环境中的完整执行,则超出了它的证据范围。 [10]

读排行榜前,先检查这些条件

  • Pass@1 与 Pass@k:多次尝试的收益不能当成单次执行可靠性。
  • 预算是否相同:包括训练 token、后训练计算量、推理 token、工具调用上限与并行采样。
  • 工具和环境是否一致:不同搜索源、缓存、网页快照和工具权限会改变难度。
  • 是否同源泄漏:按文档、仓库、技能包和任务来源去重,比只去掉完全相同的字符串更有意义。
  • 平均数背后是什么:同时报告逐项表现、重复运行的不确定性,以及调用失败和任务失败的区别。

这些是本文建议的审阅标准。它们也解释了为什么不把不同论文的最终 agent 分数直接画成一张“谁最好”的排行榜。

如何设计一个有说服力的 CPT 实验?

下面是一套研究设计建议,不是某篇论文已经验证的通用最优配方。先定义失败类型,再选择材料:知识不足、工具语义不清、计划不合理和执行后不纠错,未必需要同一种训练数据。

从四组可比较的实验开始

组别 中间训练阶段 后训练
A / 基线 无 CPT 固定 SFT;若用 RL,固定环境与预算
B / 通用 CPT 普通文本与代码 与 A 使用相同配方
C / 轨迹 CPT 工具文档与行动轨迹,加入通用回放 与 A 使用相同配方
D / 技能 CPT 技能包及支持文件,加入通用回放 与 A 使用相同配方

B、C、D 应先匹配训练 token,并记录实际 FLOPs;相同 token 不保证长上下文和不同架构下计算量相同。A 用于判断“加一个阶段”的收益,B 用于判断“只要多训练就能提高”的解释。若要主张更高计算效率,还应增加把同等预算投入后训练的对照。

一个数据构造的具体例子

假设任务是使用内部库存 API 查找可发货商品。文档只写着参数、分页和返回字段;训练材料可以保留这些事实,再组织出不同情境:

文档:list_stock(sku, cursor) 返回库存与 next_cursor
任务:汇总商品 X 在全部仓库的可用库存
计划:先查询第一页,再按 next_cursor 遍历
行动:list_stock(sku="X", cursor=null)
观察:第一页库存为 12,next_cursor="p2"
判断:还有下一页,不能把 12 当成最终库存
下一步:使用 p2 查询,继续累计

异常变体:超时、空页、重复游标、字段缺失
标注:哪些观察来自真实执行,哪些是模拟数据

这是本文构造的教学示例,API、库存数字与观察均为假设,不是任何论文中的实验数据。

关键在于把条件写完整。如果把中途失败的轨迹直接当作成功示范,模型可能学到错误动作;如果只保留成功终点,又可能丢掉恢复策略。应区分原始轨迹、修复轨迹、候选动作和已执行动作,明确它们的监督角色。

先做小规模消融,再决定是否扩展

优先分别比较:原始文档与任务化文档;仅成功轨迹与带标签的失败/修复轨迹;技能主文件与完整依赖包;不同通用回放比例;短上下文与长上下文。每次改变一个关键因素,同时记录通用能力回退。数据配比应由本项目的帕累托权衡决定,不直接照搬论文里的单点结果。

从 base 模型开始通常更容易解释“CPT→后训练”的因果链。如果必须从 instruct 模型续训,应把指令遵循和工具输出格式纳入回归评估,并保留原模型作为对照。只有当目标任务提升、旧能力损失、训练成本三者一起可接受,扩展数据规模才有依据。

下一步值得研究什么?

这批工作把关注点从“往模型里增加多少数据”推进到了“如何把知识和经验组织成模型能学会的材料”。以下是基于上述论文提出的研究判断,并非已经建立的事实。

  1. 从技能文本到可执行验证。技能包和合成行动降低了数据构造门槛,但能否用少量真实执行,校准大量离线材料中的错误假设?可以比较纯离线、抽样执行验证与全轨迹监督。
  2. 区分知识迁移与决策迁移。换一套 API 名称或全新网站,模型还能否保持规划和恢复能力?未见工具、未见环境与未见任务组合应分开测试。
  3. 把后训练样本效率作为主要指标。除了固定预算的最终分数,还要比较达到同一成功率需要多少 SFT 样本、RL 交互与总 FLOPs。
  4. 追踪多轮更新。一次 CPT 成功不代表能够不断续训。可设计多批次工具更新与领域变化,观察知识保留、路由变化、技能冲突和错误积累。
  5. 联动参数学习与外部记忆。稳定且高频的规律可能适合进入权重,频繁变化的工具说明可能更适合检索;两者的划分应由更新成本与任务收益决定。

如果按问题来读论文:先用 Don’t Stop Pretraining 和 AdaptLLM 理解“为什么还要继续学、为什么原文不够”;再用 re-warming 与 replay 系列理解“怎样继续学”;接着读 Hephaestus、AgentFounder、SPT 比较三类行动材料,最后用 APTBench 反过来审视训练目标是否可测。 [1] [4] [2] [3] [8] [9] [11] [10]

论文与一手资料索引

范围:面向 LLM 的持续预训练、可学习语料组织、直接面向智能体的 CPT 与训练中评估。以 arXiv 原文、会议论文和作者官方报告为依据;这是一份有选择的研究综述,不声称穷尽全部文献。结果按所链接版本解释,检索截至 2026 年 9 月 8 日;新预印本与作者报告不视为独立复现。未在本文中重新训练或复现实验。

  1. Don’t Stop Pretraining: Adapt Language Models to Domains and Tasks

    Gururangan et al. · 2020 · ACL · 源头 / DAPT 与 TAPT

    领域与任务自适应预训练的经典实证;研究对象是早期预训练语言模型,不能直接等同于今天的生成式智能体。

  2. Continual Pre-Training of Large Language Models: How to (re)warm your model?

    Gupta et al. · 2023 · arXiv v2 · 优化 / 学习率

    在 Pythia 410M 上研究重新升温、初始化检查点与短期损失上升。

  3. Simple and Scalable Strategies to Continually Pre-train Large Language Models

    Ibrahim et al. · 2024 · arXiv v4 · 优化 / 回放与再衰减

    405M 与 10B 实验支持简单 CPT 配方;不同规模所验证的分布变化强度不同。

  4. Adapting Large Language Models via Reading Comprehension

    Cheng, Huang & Wei · 2023 首发 · ICLR 2024 · 数据 / AdaptLLM

    把领域原始文本转成阅读理解任务,缓解知识吸收与问答提示能力之间的冲突。

  5. Instruction Pre-Training: Language Models are Supervised Multitask Learners

    Cheng et al. · 2024 · EMNLP · 数据 / 指令合成

    将大规模指令—回答对纳入预训练;连接原始文本训练与指令学习。

  6. Synthetic continued pretraining

    Yang et al. · 2024 首发 · ICLR 2025 · 数据 / EntiGraph

    通过实体关联生成多样化文本,提高小语料的知识学习效率,并检验与 RAG 的互补性。

  7. Continual Pre-training of MoEs: How robust is your router?

    Thérien et al. · 2025 · arXiv · 架构 / MoE

    研究分布迁移中的路由鲁棒性、负载均衡与回放;为稀疏模型的 CPT 提供实证。

  8. Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models Through Continual Pre-Training

    Zhuang et al. · 2025-02 · arXiv v1 · Agentic CPT / 语料与配比

    以 Hephaestus-Forge 组织 API 文档和调用轨迹,研究 agent、文本与代码数据的混合。

  9. Scaling Agents via Continual Pre-training

    Su et al. · 2025-09 首发 · ICLR 2026 · Agentic CPT / AgentFounder

    本文方法与数值采用 arXiv v1;会议版本可在 OpenReview 检索同名论文。

  10. APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

    Qin et al. · 2025-10 · arXiv v1 · 评估 / 基础模型潜力

    用选择题与文本补全评估规划和行动潜力,降低训练中评估的成本。

  11. SPT: Skills as Pre-Training Data for Agentic Language Models

    Sun, Li & Cheng · 2026-08-27 · arXiv v1 · 新进展 / 技能包

    将多文件技能包用于 causal LM 中期训练;截至本文检索日按预印本看待。

  12. Tongyi DeepResearch Technical Report

    Alibaba Tongyi Lab · 2025 · 官方技术报告 · 系统 / CPT → SFT → RL

    说明 Agentic CPT 如何接入完整系统训练;与 AgentFounder 有研究和工程关联,不计为独立复现。


点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。