从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述
持续预训练如何改变模型的知识、能力与后训练起点?本文沿着数据、优化与评估三条线,整理 12 篇论文与技术报告,梳理从领域适配到 Hephaestus、AgentFounder 和 SPT 的研究脉络。
检索截至 2026 年 9 月 8 日。文中区分论文结果、研究判断与教学示例,附一手来源链接。
关于 FAS、HAS 与训练流程的更详细分析,可继续阅读本站的 AgentFounder 精读。
CPT 改变了什么?
大语言模型学会回答问题之后,为什么还要回到预训练?因为后训练所能调用的知识、行为模式和探索起点,受到基础模型的影响。传统 CPT 研究如何以较小代价吸收新数据;Agentic CPT 则进一步研究,能否在后训练之前,就让模型接触规划、工具调用和环境反馈。 [3] [8] [9]
本文的判断:Agentic CPT 的价值在于改善后训练的起点。评估它时,既要看最终任务表现,也要问:同样的后训练预算,是否能得到更好的智能体?
CPT 通常指从已有权重继续进行预训练。Continued 更常描述一个续训阶段,Continual 更强调多次或连续更新,但文献中用法并不统一。DAPT 是面向领域的适配,TAPT 是面向任务无标签数据的适配;mid-training 则更多描述训练阶段的位置,不能仅凭这个名称判断数据和损失函数。 [1] [3] [11]
| 范式 | 主要学习材料与信号 | 需要分清的边界 |
|---|---|---|
| 传统 CPT | 新领域、语言或时间段的文本;语言建模损失 | 可以是一次离线续训,不必是终身学习 |
| Agentic CPT | 工具文档、规划、轨迹、反馈、技能包;通常仍用语言建模目标 | 学习行动先验,不自动意味着真实交互或在线更新 |
| SFT | 指令与示范;常对回答部分计算监督损失 | 和 CPT 都可能用交叉熵,区别不能只看公式 |
| Agentic RL | 与环境交互后获得奖励,优化策略 | 训练信号和采样过程不同于离线文本预测 |
| RAG / 外部记忆 | 推理时检索文档或历史经验 | 通常不更新基础模型参数,可与 CPT 组合 |
上表是本文采用的工作定义。真实系统可能混用数据与损失掩码,应以论文的训练实现为准。
通用预训练 → Agentic CPT → SFT → RL
分别学习语言与知识、行动相关材料、任务示范,以及交互结果优化。
这是代表性流程示意,不要求每项研究都包含全部阶段。Tongyi DeepResearch 的报告明确采用这条训练链路。 [12]
对自回归模型,可以用一个统一写法理解文本学习:
1 | |
这个公式本身并不保证智能体能力。决定模型学到什么的关键,还包括训练序列如何表达“观察—判断—行动”、哪些 token 被监督、失败是否被标记,以及模型接触过多少不同环境。下面沿这条线索梳理研究。
传统 CPT:从领域适配到可学习的数据
第一条线:新领域值得继续学,但“学进去”不等于“用得出”
Don’t Stop Pretraining 在四个领域、八个分类任务中验证了 DAPT 和 TAPT 的价值。它确立的是“通用预训练后仍有适配空间”这一研究起点,而不是关于现代聊天模型的直接结论。 [1]
到了生成式 LLM,AdaptLLM 发现,直接学习领域原始文本可能改善知识吸收,却损害问答提示能力;将文本改造成阅读理解材料,可以缩小这种差距。Instruction Pre-Training 则用指令合成器把原始语料扩展为大量任务—回答样本,说明指令结构也可以更早进入训练。 [4] [5]
由此得到的设计启发:领域语料的“专业程度”与训练样本的“可学习程度”不是同一个维度。读完一本 API 手册后,模型是否能在真实任务中选对参数,需要另行验证。
第二条线:续训要同时处理适应、遗忘与优化状态
How to (re)warm your model? 在 Pythia 410M 上发现,重新提高学习率会带来短期损失上升,但能改善较长训练后的新分布表现。后续 Simple and Scalable Strategies 将重新升温、再次衰减和旧数据回放结合起来,在其测试范围内接近从头重训的效果;其中 10B 实验验证的是较弱分布变化,不能外推为所有迁移情形。 [2] [3]
MoE 还涉及专家路由与负载分配。How robust is your router? 在所研究的模型和路由方式下观察到较强鲁棒性,并保留了相对 FLOP 匹配稠密模型的样本效率。这为 MoE 续训提供依据,但不是对任意路由器、任意领域偏移的保证。 [7]
实践中应把“新数据学得更快”和“旧能力掉得更少”画成两条曲线。只监控新领域训练损失,很容易把过拟合当成适配成功;只用结束时的一个综合分数,也可能掩盖训练过程中的回退。
第三条线:小语料瓶颈可以通过重组知识缓解
EntiGraph 从小规模文档中提取实体,再围绕实体关联生成多样化文本,用这些合成数据续训。它强调的是增加知识出现的角度与联系,而非机械重复原文;论文还发现,参数中的知识可以与推理时的检索结合。 [6]
这条线索对 Agentic CPT 很有启发:如果静态知识可以改写成学习材料,操作手册也可以改写成计划、工具选择和故障恢复练习。不过,合成过程必须保留事实与反馈的来源;“模型写得像真的”不能替代执行验证。
Agentic CPT:让行动相关知识提前进入模型
Hephaestus:先把工具世界整理成语料
2025 年 2 月的 Hephaestus 是这条路线的直接代表。Hephaestus-Forge 包含约 103B agent 专用 token,覆盖 76,537 个 API,结合工具文档与调用轨迹。研究还利用小模型探索数据配比:在其设置下,agent 数据约占 36% 较优,接近 agent、通用文本、代码 1∶1∶1;随后进行两阶段 CPT 与指令微调。 [8]
值得借鉴的是“文档知识+行为材料+通用回放”的组合。这里的 36% 是特定数据、模型和评估条件下的结果,不能直接当作所有 agent 模型的默认超参数。103B 指语料规模,也不等于完整训练总 token 数。
AgentFounder:把静态知识与已有轨迹改造成决策材料
Scaling Agents via Continual Pre-training 将 Agentic CPT 显式放在基础预训练与后训练之间。其两类数据构造分别是:FAS 从知识构造问题、规划与首步行动;HAS 在已有轨迹的步骤上扩展候选行动,再组织选择、原始反馈及结果判断。新增候选的合成不需要实际调用外部工具。 [9]
论文采用 32K 到 128K 的两阶段上下文训练。数据规模实验从 0 到 315B token,多个 agent 基准的平均 Pass@3 从 54.2% 到 62.2%,即提高 8.0 个百分点。这是论文特定评估协议下的结果,不能换写成单次成功率,也不能认为每个基准都提升了 8 个点。 [9]
需要保留的区别:候选行动有多个,不代表每个候选都获得了真实执行反馈。离线扩展行动空间,可以增加学习材料的多样性;它是否带来对未见工具的可靠探索,仍需交互实验。
阅读这篇论文时,更有价值的问题是:性能提升来自哪些数据、上下文长度和后训练设置?不要把“第一篇”的叙述扩大为整个领域的起源;Hephaestus 更早研究了通过 CPT 增强 agent 能力。 [8] [9]
SPT:技能包成为第三类训练材料
2026 年 8 月的 SPT 将技能包用于中期语言建模训练。它用 Reference Insert 把支持文件放在主说明中引用它们的位置附近,尽量保留跨文件关系。主实验对比普通语料、AgentBank 轨迹和 SkillCorpus,统一中期训练预算为 347,770,880 token,并使用相同后训练配方。 [11]
在 OLMo-3-1025-7B+xLAM-FC 设置中,四项 agent 评估的未加权均值为:不做中期训练 28.50,轨迹数据 44.05,技能数据 53.46。最后两个条件之差是 9.41 个百分点。这组对照支持技能材料的价值;它仍属于特定模型与评测下的预印本结果,不能推出技能包普遍优于执行轨迹。 [11]
本文认为,它揭示了三种互补的学习材料:文档解释“工具是什么”,轨迹展示“任务怎么做过”,技能包表达“某类任务可以怎样做”。技能包中的流程和依赖关系,可能比孤立调用记录更容易复用;这是值得继续验证的假设。
| 代表方向 | 数据组织方式 | 优先检验的问题 |
|---|---|---|
| Hephaestus | API 文档+调用轨迹+通用文本与代码 | 覆盖度、配比与通用能力保留 |
| AgentFounder | 知识→问题/行动;轨迹→多选项决策文本 | 离线合成是否改善真实长程决策 |
| SPT | 主技能说明+被引用的脚本、模板与参考文件 | 跨文件组织是否带来未见工作流迁移 |
表格综合自 [8]、[9]、[11];最后一列为本文提出的评估重点。
什么证据,才说明 CPT 真有用?
训练 loss 下降说明模型更善于预测训练分布,并不充分说明它更能完成任务。最终系统分数又混合了 CPT、SFT、RL、工具、提示词和推理预算的影响。因此,需要分层看证据。
| 评估层 | 要回答的问题 | 建议记录 |
|---|---|---|
| 基础模型 | CPT 后是否形成了行动相关知识与偏好? | 留出集损失、工具语义、规划与行动选择 |
| 相同后训练 | 给定同样的 SFT/RL,CPT 是否改善起点? | 相同数据、训练步数下的任务分数与学习曲线 |
| 端到端系统 | 真实执行是否可靠,成本是否合理? | 任务成功率、调用次数、延迟、失败类型 |
| 迁移与保留 | 收益是否超过训练场景,旧能力是否退化? | 未见 API/网站/任务、通用能力与旧任务回归 |
APTBench 正是为第一层设计的:把真实任务与成功轨迹改造成适合 base 模型的选择或补全问题,覆盖软件工程与深度研究中的规划和行动。论文报告它能提供较有预测力的下游 agent 信号。它适合用于训练中筛选检查点;替代真实环境中的完整执行,则超出了它的证据范围。 [10]
读排行榜前,先检查这些条件
- Pass@1 与 Pass@k:多次尝试的收益不能当成单次执行可靠性。
- 预算是否相同:包括训练 token、后训练计算量、推理 token、工具调用上限与并行采样。
- 工具和环境是否一致:不同搜索源、缓存、网页快照和工具权限会改变难度。
- 是否同源泄漏:按文档、仓库、技能包和任务来源去重,比只去掉完全相同的字符串更有意义。
- 平均数背后是什么:同时报告逐项表现、重复运行的不确定性,以及调用失败和任务失败的区别。
这些是本文建议的审阅标准。它们也解释了为什么不把不同论文的最终 agent 分数直接画成一张“谁最好”的排行榜。
如何设计一个有说服力的 CPT 实验?
下面是一套研究设计建议,不是某篇论文已经验证的通用最优配方。先定义失败类型,再选择材料:知识不足、工具语义不清、计划不合理和执行后不纠错,未必需要同一种训练数据。
从四组可比较的实验开始
| 组别 | 中间训练阶段 | 后训练 |
|---|---|---|
| A / 基线 | 无 CPT | 固定 SFT;若用 RL,固定环境与预算 |
| B / 通用 CPT | 普通文本与代码 | 与 A 使用相同配方 |
| C / 轨迹 CPT | 工具文档与行动轨迹,加入通用回放 | 与 A 使用相同配方 |
| D / 技能 CPT | 技能包及支持文件,加入通用回放 | 与 A 使用相同配方 |
B、C、D 应先匹配训练 token,并记录实际 FLOPs;相同 token 不保证长上下文和不同架构下计算量相同。A 用于判断“加一个阶段”的收益,B 用于判断“只要多训练就能提高”的解释。若要主张更高计算效率,还应增加把同等预算投入后训练的对照。
一个数据构造的具体例子
假设任务是使用内部库存 API 查找可发货商品。文档只写着参数、分页和返回字段;训练材料可以保留这些事实,再组织出不同情境:
文档:list_stock(sku, cursor) 返回库存与 next_cursor
任务:汇总商品 X 在全部仓库的可用库存
计划:先查询第一页,再按 next_cursor 遍历
行动:list_stock(sku="X", cursor=null)
观察:第一页库存为 12,next_cursor="p2"
判断:还有下一页,不能把 12 当成最终库存
下一步:使用 p2 查询,继续累计
异常变体:超时、空页、重复游标、字段缺失
标注:哪些观察来自真实执行,哪些是模拟数据
这是本文构造的教学示例,API、库存数字与观察均为假设,不是任何论文中的实验数据。
关键在于把条件写完整。如果把中途失败的轨迹直接当作成功示范,模型可能学到错误动作;如果只保留成功终点,又可能丢掉恢复策略。应区分原始轨迹、修复轨迹、候选动作和已执行动作,明确它们的监督角色。
先做小规模消融,再决定是否扩展
优先分别比较:原始文档与任务化文档;仅成功轨迹与带标签的失败/修复轨迹;技能主文件与完整依赖包;不同通用回放比例;短上下文与长上下文。每次改变一个关键因素,同时记录通用能力回退。数据配比应由本项目的帕累托权衡决定,不直接照搬论文里的单点结果。
从 base 模型开始通常更容易解释“CPT→后训练”的因果链。如果必须从 instruct 模型续训,应把指令遵循和工具输出格式纳入回归评估,并保留原模型作为对照。只有当目标任务提升、旧能力损失、训练成本三者一起可接受,扩展数据规模才有依据。
下一步值得研究什么?
这批工作把关注点从“往模型里增加多少数据”推进到了“如何把知识和经验组织成模型能学会的材料”。以下是基于上述论文提出的研究判断,并非已经建立的事实。
- 从技能文本到可执行验证。技能包和合成行动降低了数据构造门槛,但能否用少量真实执行,校准大量离线材料中的错误假设?可以比较纯离线、抽样执行验证与全轨迹监督。
- 区分知识迁移与决策迁移。换一套 API 名称或全新网站,模型还能否保持规划和恢复能力?未见工具、未见环境与未见任务组合应分开测试。
- 把后训练样本效率作为主要指标。除了固定预算的最终分数,还要比较达到同一成功率需要多少 SFT 样本、RL 交互与总 FLOPs。
- 追踪多轮更新。一次 CPT 成功不代表能够不断续训。可设计多批次工具更新与领域变化,观察知识保留、路由变化、技能冲突和错误积累。
- 联动参数学习与外部记忆。稳定且高频的规律可能适合进入权重,频繁变化的工具说明可能更适合检索;两者的划分应由更新成本与任务收益决定。
如果按问题来读论文:先用 Don’t Stop Pretraining 和 AdaptLLM 理解“为什么还要继续学、为什么原文不够”;再用 re-warming 与 replay 系列理解“怎样继续学”;接着读 Hephaestus、AgentFounder、SPT 比较三类行动材料,最后用 APTBench 反过来审视训练目标是否可测。 [1] [4] [2] [3] [8] [9] [11] [10]
论文与一手资料索引
范围:面向 LLM 的持续预训练、可学习语料组织、直接面向智能体的 CPT 与训练中评估。以 arXiv 原文、会议论文和作者官方报告为依据;这是一份有选择的研究综述,不声称穷尽全部文献。结果按所链接版本解释,检索截至 2026 年 9 月 8 日;新预印本与作者报告不视为独立复现。未在本文中重新训练或复现实验。
Don’t Stop Pretraining: Adapt Language Models to Domains and Tasks
Gururangan et al. · 2020 · ACL · 源头 / DAPT 与 TAPT
领域与任务自适应预训练的经典实证;研究对象是早期预训练语言模型,不能直接等同于今天的生成式智能体。
Continual Pre-Training of Large Language Models: How to (re)warm your model?
Gupta et al. · 2023 · arXiv v2 · 优化 / 学习率
在 Pythia 410M 上研究重新升温、初始化检查点与短期损失上升。
Simple and Scalable Strategies to Continually Pre-train Large Language Models
Ibrahim et al. · 2024 · arXiv v4 · 优化 / 回放与再衰减
405M 与 10B 实验支持简单 CPT 配方;不同规模所验证的分布变化强度不同。
Adapting Large Language Models via Reading Comprehension
Cheng, Huang & Wei · 2023 首发 · ICLR 2024 · 数据 / AdaptLLM
把领域原始文本转成阅读理解任务,缓解知识吸收与问答提示能力之间的冲突。
Instruction Pre-Training: Language Models are Supervised Multitask Learners
Cheng et al. · 2024 · EMNLP · 数据 / 指令合成
将大规模指令—回答对纳入预训练;连接原始文本训练与指令学习。
Synthetic continued pretraining
Yang et al. · 2024 首发 · ICLR 2025 · 数据 / EntiGraph
通过实体关联生成多样化文本,提高小语料的知识学习效率,并检验与 RAG 的互补性。
Continual Pre-training of MoEs: How robust is your router?
Thérien et al. · 2025 · arXiv · 架构 / MoE
研究分布迁移中的路由鲁棒性、负载均衡与回放;为稀疏模型的 CPT 提供实证。
-
Zhuang et al. · 2025-02 · arXiv v1 · Agentic CPT / 语料与配比
以 Hephaestus-Forge 组织 API 文档和调用轨迹,研究 agent、文本与代码数据的混合。
Scaling Agents via Continual Pre-training
Su et al. · 2025-09 首发 · ICLR 2026 · Agentic CPT / AgentFounder
本文方法与数值采用 arXiv v1;会议版本可在 OpenReview 检索同名论文。
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
Qin et al. · 2025-10 · arXiv v1 · 评估 / 基础模型潜力
用选择题与文本补全评估规划和行动潜力,降低训练中评估的成本。
SPT: Skills as Pre-Training Data for Agentic Language Models
Sun, Li & Cheng · 2026-08-27 · arXiv v1 · 新进展 / 技能包
将多文件技能包用于 causal LM 中期训练;截至本文检索日按预印本看待。
Tongyi DeepResearch Technical Report
Alibaba Tongyi Lab · 2025 · 官方技术报告 · 系统 / CPT → SFT → RL
说明 Agentic CPT 如何接入完整系统训练;与 AgentFounder 有研究和工程关联,不计为独立复现。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。