AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据

如果训练 Agent 总要在线搜索、访问网页、执行代码,再筛选少量成功轨迹,数据规模很快就会被环境调用成本卡住。那些没有完成任务的轨迹,以及海量没有“行动格式”的网页知识,能不能也用来训练 Agent?

AgentFounder 的答案是:先把它们改造成适合继续预训练的数据,让基座提前接触行动、决策与反馈,再做下游 SFT。 它的重点不是新的奖励函数,而是如何低成本扩大 Agent 训练数据,以及怎样使用不完美的历史经验。

本文精读 Scaling Agents via Continual Pre-training(Liangcai Su 等,Tongyi Lab;arXiv v1,2025-09-16),依据正文、附录和原始图表整理。实验分数均指论文当时的设置,不代表当前排行榜;下面的数值示例是教学构造,不是作者公开的训练样本。

1. 一句话结论与论文全景

把 Agent 的基础行为学习前移到大规模继续预训练,可以提高同一基座在多种下游 SFT 配方下的表现;关键是把无交互的知识合成和有真实反馈的轨迹复用结合起来。

论文在 Qwen3-30B-A3B-Base 上构建 AgentFounder。这里 30B-A3B 是 MoE 模型的规模标识,不是每个 token 都激活全部 30B 参数;训练数据规模则是另一个量级:正文概述约 200B + 100B tokens 的两阶段 Agentic CPT。

环节 输入 处理方式 作用
FAS:一阶动作合成 网页、离线知识、历史工具结果 构造问题,合成下一步计划或知识推理,不执行新工具调用 低成本扩展基础行为和知识利用能力
HAS:高阶动作合成 带真实工具反馈及最终成败的历史轨迹 每一步增加候选动作,保留原动作与原反馈,组织成选择过程 将已有交互经验展开为更丰富的决策文本
Agentic CPT 上述数据与知识推理语料 先 32K,再 128K 上下文;预测下一个 token 提前学习 Agent 行为分布
下游 SFT 通用指令与 Agent 示范 不同混合及阶段安排 形成最终可用的 Agent

最有说服力的结果不是跨模型排行榜,而是同基座、同 SFT 数据的比较:使用 SFT-B 时,增加 Agentic CPT 后,BrowseComp-en 从 28.6 提高到 39.9,HLE 从 27.0 提高到 31.5,分别增加 11.3 和 4.5 个百分点。(表 3)

注意这里比较的是 “CPT 后再 SFT”与“直接 SFT”,不是 CPT 裸模型与最终 Agent,也不是一次新 RL 算法对旧 RL 算法的比较。

2. Motivation:为什么不能把一切都交给后训练?

2.1 后训练承担了两份工作

通用预训练擅长让模型获取知识和语言规律,但自然文本不一定充分包含“遇到不确定性时搜索、根据观察调整行动、失败后换路线”的交互结构。

于是 Agent 后训练同时承担两件事:一是让模型学会广泛的行动方式,二是让它对齐某套高质量示范的具体格式和策略。作者将这种负担视为瓶颈:只靠少量严格筛选的完整轨迹,既要获得行为覆盖,又要获得高质量执行,容易把模型推向特定轨迹的模仿。(§1、§2)

Agentic CPT 的研究假设是:先让基座读懂大量行动和决策经验,再做精细对齐,下游训练会更容易。 这里的 continual pre-training 指在已有基座上继续训练,不等同于持续在线学习、测试时更新参数或终身学习系统。

2.2 成功轨迹很贵,失败轨迹又不是真的毫无价值

完整 Agent 轨迹需要工具执行和环境反馈。长链任务中,即使前面十步搜索和阅读都合理,最后一步综合答案出错,也可能导致整条轨迹被拒绝采样过滤掉。

直接把它作为成功示范不对,但全部扔掉同样浪费:历史搜索结果是真实的,中间问题状态是真实的,局部决策面对的候选空间也值得学习。问题在于最终失败不能可靠告诉我们究竟哪一步错了,贸然生成逐步奖励又可能引入噪声。

因此论文选择了一条不同路线:不强行给每步打精确 reward,而是重组训练文本。 FAS 解决数据来源与规模,HAS 解决真实经验的利用方式。

3. Method:FAS、HAS 与两阶段 CPT

3.1 FAS:不执行新工具,也能合成行动训练数据

FAS 的起点不是凭空编出一条完整工具轨迹,而是已有的信息资源:高质量网页、历史搜索及访问结果、离线 Wikipedia,以及过去训练中被丢弃的材料。(§2.2、§3.1.1)

第一步:把知识整理成可出题的上下文。 作者将原始文本转为按实体组织的陈述性知识,保留时间和来源信息;这不是必须遵守固定关系模式的知识图谱。随后采样实体簇及关联事实,构造事实查询、数值问题、多跳问题或综合性问题,并关联解题所需知识。

第二步:合成 planning action。 给定问题和相关上下文,让模型生成分析,以及下一步工具调用或直接回答。生成过程中不真的调用新 API。作者还将“同一问题重复采样多次”调整为“共享知识记忆的多种问题风格”,以减少近似计划与重复问题 token。

过滤器用 LLM-as-judge 判断计划与所需知识是否对齐,例如搜索方向是否可能获取必要信息。但这只是对计划的判断,不等于已经验证搜索执行成功

第三步:合成 reasoning action。 这是一条互补的数据生成路径,不是每条 planning action 后面都接一个工具结果:

  1. 先只给问题,让模型拆成子问题,利用自身知识形成初步答案 \(A_1\)
  2. 再给问题对应的必要知识,让模型修正推理,得到 \(A_2\)
  3. 用 judge 比较 \(A_2\) 与参考答案,保留符合条件的样本。

先不展示证据、后展示证据,是为了鼓励分析和修正,而不是一开始机械地把提供的事实抄成推理链。两步都不调用外部工具。(§2.2.3)

论文将 FAS 称为 “Zero Supervisory Signal”。准确理解是:它不依赖新生成完整交互轨迹后的环境成败监督;并非没有知识来源、参考答案、生成模型或质量过滤器。

3.2 HAS:展开决策空间,但不伪造未执行分支的反馈

设历史轨迹为:

\[ T=\{(S_1,R_1),\ldots,(S_K,R_K)\},\qquad J\in\{0,1\}. \]

\(S_k\) 是第 \(k\) 步的思考和工具调用,\(R_k\) 是对应的真实历史反馈,\(J\) 是整条轨迹最终失败或成功的标签。第 \(k\) 步已经知道的上下文是:

\[ C_k=(Q,S_1,R_1,\ldots,S_{k-1},R_{k-1}). \]

HAS 在这个上下文下离线生成 \(N\) 个额外候选思考与调用,再加入原动作 \(S_k^{(0)}=S_k\)。打乱这 \(N+1\) 个选项,记录原动作的新位置 \(n_k\)。(§2.3、图 5)

接下来合成的文本依次包含:候选选项、选择第 \(n_k\) 项的陈述、原来的真实反馈 \(R_k\)。最后追加对应 \(J\) 的 Correct / Incorrect 判断文本。

最容易误读的是:它选择的是原动作在打乱后的编号,不是执行所有分支后选出最优动作。 这样才能保证后面的真实反馈确实对应所选调用。额外候选没有被执行,因此也没有它们的真实反馈。

一条 \(K\) 步轨迹会展示:

\[ \text{候选动作总数}=(N+1)K. \]

这不是执行了 \((N+1)^K\) 条搜索路径,也不是获得了逐步最优动作标签。最终的失败标签同样不能解释为“每个中间动作都是错的”。

作者称这类文本为 Contrastive Decision-Action Synthesis,但训练目标仍是语言建模;不要因为出现 “contrastive” 就把它理解成另加了一个对比损失或偏好优化目标。

3.3 两阶段训练:先覆盖,再保留长轨迹结构

正文 §2.1 给出的整体预算是:

阶段 数据量 上下文长度 目的
Agentic CPT Stage 1 约 200B tokens 32K 学习工具模式、基础推理与行动知识
Agentic CPT Stage 2 100B tokens 128K 使用精选 Agent 数据,保留更完整的长交互结构
SFT 本文不补造未公开的精确配比 按论文后训练配置 对齐通用对话与 Agent 执行

后面的 scaling 实验另展示到 315B tokens 的检查点。概述中的约 300B 与 scaling 曲线的 315B 不应被强行写成完全相同的精确预算。

训练仍使用论文式 (1) 的 next-token prediction。对一段序列,其损失可写为:

\[ \mathcal L=-\sum_t\log p_\theta(x_{t+1}\mid x_{\leq t}),\qquad \mathbf p_t=\operatorname{softmax}(W_o h_t). \]

其中 \(h_t\in\mathbb R^d\) 是隐藏状态,\(W_o\in\mathbb R^{V\times d}\) 将它投影到 \(V\) 个词表项,\(\mathbf p_t\in\mathbb R^V\) 是下一个 token 的概率分布。训练的变化主要发生在模型读到什么样的序列,而不是换掉这条损失函数。

推理时,最终模型在单 Agent ReAct 框架下自主思考、调用工具并接收新反馈,不是要求用户提供 FAS 的知识答案,也不是必须先由外部生成器列出 HAS 的候选选项。

4. 具体数值例子:从知识材料到一次训练贡献

以下全部是教学用简化示例。虚构实体“星河研究所”、两个交互步骤、两个额外候选和概率值,都不是论文实际超参数或实验数据。

4.1 FAS:知识变问题,再变计划与修正推理

假设离线材料包含两条有来源的陈述:

  • 星河研究所 2023 年论文数为 100 篇。
  • 星河研究所 2024 年论文数为 120 篇。

将它们按实体归并后,构造问题:“星河研究所 2024 年论文数相对 2023 年增长了多少?” 同一组知识还可以生成“增加多少篇”“哪一年更多”等问题,但这些不意味着新增了独立事实。

规划样本可以是:“需要核实两年的同口径数量,下一步搜索该研究所两年的年度报告。”然后输出一个搜索调用。合成器到这里就可以结束,不真的搜索,也不编造搜索返回值。

推理样本走另一条路径:第一轮只看问题,模型可能暂时猜测增长 15%,形成 \(A_1\);第二轮看到两条已知事实,修正为:

\[ g=\frac{n_{2024}-n_{2023}}{n_{2023}} =\frac{120-100}{100}=0.20=20\%. \]

\(n_{2023}\)\(n_{2024}\) 单位为篇,增长率 \(g\) 无量纲。\(A_2\) 输出“增长 20%,增加 20 篇”;judge 对照参考答案后可以保留它。第一轮猜测仅说明合成流程如何工作,并不是建议真实服务无证据时随意猜数。

4.2 HAS:原轨迹怎样展开成决策文本?

另假设历史系统曾真实运行过同一问题,留下两步成功轨迹:

步骤 原动作 \(S_k\) 记录的真实反馈 \(R_k\)
1 搜索研究所 2023、2024 年论文数量 搜索记录给出 100 篇、120 篇及来源
2 Python 计算 print((120-100)/100) 0.2

最终答案为 20%,所以 \(K=2\)\(J=1\)。现在每步生成 \(N=2\) 个替代候选,并打乱:

状态 选项 1 选项 2 选项 3 保留的原动作编号
\(C_1=Q\) 未搜索直接猜测 搜索两年论文数(原动作) 搜索研究所人员数量 \(n_1=2\)
\(C_2=(Q,S_1,R_1)\) Python 计算增长率(原动作) 再搜索第三方统计 使用 2024 年数量作分母 \(n_2=1\)

候选可能优劣混杂;表中错误分母尤其说明“生成了候选”不代表“验证为正确”。HAS 的合成过程不会把选项 2 或 3 额外执行一遍再比较结果。

训练文本于是大致成为:

1
2
3
4
5
6
7
8
问题:2024 年相对 2023 年论文数增长多少?
第一步候选:[直接猜测;搜索两年数量;搜索人员数量]
选择选项 2。
真实历史反馈:2023 年 100 篇,2024 年 120 篇。
第二步候选:[计算增长率;再搜索;换一个分母]
选择选项 1。
真实历史反馈:0.2。
最终判断:Correct。

这里展示了 \((2+1)\times2=6\) 个候选动作,但仍然只有原轨迹中的 2 份真实工具反馈,不是 9 条已经跑过的路径。

如果原轨迹第二步实际上用了错误分母,得到 \((120-100)/120\approx16.67\%\),HAS 会保留那个原调用和实际返回值,并在结尾记录 Incorrect;它不会事后把真实历史替换成一个虚构的正确执行。这个保真原则很重要,但也留下“错误选择会如何影响语言建模”的问题。

4.3 把 next-token 损失算一遍

真实序列包含大量 token。为便于手算,只取其中四个目标 token 位置,其预测正确 token 的概率依次为 \(0.5,0.25,0.8,0.4\)。这四项对完整训练损失的贡献为:

\[ \begin{aligned} \mathcal L_{\mathrm{4\ positions}} &=-\log0.5-\log0.25-\log0.8-\log0.4\\ &=0.6931+1.3863+0.2231+0.9163\\ &=3.2189\ \text{nats}. \end{aligned} \]

如果只平均这四项,得到 \(3.2189/4=0.8047\) nats/token。这里省略了其他 token 的损失及 Transformer 的前向计算,并不是说真实训练只监督四个位置

再看概率 \(0.25\) 如何产生。把其中一个位置的词表简化为三个符号,对应 logits 为:

\[ z=(0,\log2,0),\qquad \operatorname{softmax}(z)=\frac{(1,2,1)}{4}=(0.25,0.5,0.25). \]

若目标恰好是第一个符号,其损失就是 \(-\log0.25=1.3863\)。交叉熵对这个目标 logit 的导数为:

\[ \frac{\partial\mathcal L}{\partial z_1}=p_1-1=0.25-1=-0.75. \]

在独立 logit 的教学近似下,用步长 \(0.1\) 做一次梯度下降,会使 \(z_1\) 增加 \(0.075\)。真实训练更新的是共享网络参数,而不是独立维护一个 logit;这个简化只用于说明梯度方向。

这揭示一个边界:结尾写 Incorrect,并不自动让前面所选动作获得负的策略梯度。 在普通 next-token 监督下,前面目标 token 的局部梯度仍推动模型预测它。模型可能通过上下文学到成败关联,但那不同于显式的逐步奖励归因,也不能直接等价为 DPO 或 RL。

5. Results:哪些证据真正支持 Agentic CPT?

5.1 先看评测条件

默认工具包括 Search、Visit、Google Scholar、Python Interpreter 和 File Parser。Search 返回每条查询的前 10 个结果;Visit 不只是下载网页,还使用摘要模型提取与目标相关的信息。(§3.1.4、附录 A.1)

AgentFounder 的推理设置为 temperature 0.85、top-p 0.95、repetition penalty 1.1,最多 128 次工具调用、128K 上下文。这里是调用上限,不是每题固定调用 128 次。

GAIA 使用 103 道文本题子集,不能写成完整多模态 GAIA 成绩。HLE 是论文的工具增强评测,不是闭卷答题。表中部分基线带有官方或其他论文来源标记,另一些由作者在统一设置下测得,因此并非所有跨模型比较都严格同工具、同预算、同评测栈。

5.2 最终模型的十项结果

评测 AgentFounder-30B 解读
BrowseComp-en 39.9 复杂英文检索
BrowseComp-zh 43.3 中文检索仍有明显差距
GAIA 文本子集 72.8 不是完整 GAIA
Xbench-DeepSearch 73.0 深度搜索任务
WebWalkerQA 71.9 网页浏览问答
HLE Pass@1 31.5 工具增强的高难问题
DeepResearch Bench 47.9 RACE Overall 评分,不是简单答对率
Frames Pass@1 89.6 多跳检索与证据综合
SEAL-0 Pass@1 43.9 干扰信息下的鲁棒性
AcademicBrowse Pass@1 75.3 学术检索任务

来源为表 1、表 2;除特别标出的评分外,按论文的百分制表现报告。不能据此声称所有任务全面领先:BrowseComp-zh 中 DeepSeek-V3.1 为 49.2,高于 43.3;OpenAI-o3 在 BrowseComp-en、zh 分别为 49.7、58.1;Gemini Deep Research 的 RACE Overall 为 49.7,也高于 47.9。

这些结果说明当时的整体系统竞争力较强,但跨模型领先不能单独证明是 CPT 某一个模块造成的。

5.3 同基座、同 SFT:更直接的有效性证据

SFT-A 先通用对话再专项 ReAct;SFT-B 在两个阶段都混合通用与 ReAct 数据;SFT-C 使用通用数据及带精简推理的 ReAct 轨迹。固定每种 SFT 配方,比较是否增加 CPT,得到:(表 3)

后训练 基座 BC-en BC-zh GAIA HLE
SFT-A 原 Qwen 基座 26.9 29.8 67.0 23.5
SFT-A AgentFounder 基座 31.4 35.6 72.8 30.4
SFT-B 原 Qwen 基座 28.6 35.6 71.8 27.0
SFT-B AgentFounder 基座 39.9 43.3 72.8 31.5
SFT-C 原 Qwen 基座 24.5 36.7 68.9 27.9
SFT-C AgentFounder 基座 38.8 44.3 71.8 28.9

三个配方的四项平均绝对增益分别约为 5.75、6.13、6.45 个百分点。原表把差值标作 Relative Δ,但展示的是百分点差,不是相对增长百分比。例如 SFT-B 的 BC-en 相对增长为 \((39.9-28.6)/28.6\approx39.5\%\),绝对提升才是 11.3 个百分点。

这支持 CPT 的收益不依赖唯一的 SFT 配方。不过它不是等总计算量实验:CPT 组额外用了大量训练 token,不能据此断言 Agentic 数据比同预算所有其他数据都更有效。

5.4 FAS 有效,但 HAS 不是每个指标都涨

表 5 使用约 50B tokens 的单阶段训练,再接 SFT-A:

CPT 数据 BC-en @1 / @3 BC-zh @1 / @3 GAIA @1 / @3
无 CPT 26.9 / 38.0 29.8 / 45.3 67.0 / 75.7
FAS 31.4 / 49.9 37.0 / 54.3 72.8 / 80.6
FAS + HAS 31.4 / 50.1 40.1 / 54.7 69.9 / 82.5

只用 FAS 已经明显优于无 CPT。加入 HAS 后,BC-zh Pass@1 增加 3.1 个百分点,GAIA Pass@3 增加 1.9,但 GAIA Pass@1 下降 2.9,BC-en Pass@1 不变。

作者将 GAIA 的下降解释为评测波动。我的判断是:没有重复训练的置信区间,尚不能确认它只是噪声;更稳妥的结论是 HAS 有互补收益,但并非所有指标一致提升。 Pass@3 也不是单次部署准确率,它衡量多次采样中至少一次成功的能力。

5.5 长上下文与规模:有效趋势,不是无限外推定律

表 4 将训练 token 固定为 50B,并使用 SFT-A。与只用第一阶段相比,两阶段的 BC-en、BC-zh、GAIA Pass@1 分别从 31.4、34.3、69.9 提高到 35.5、37.2、72.8,平均提高 3.3 个百分点。

这说明保留完整长轨迹结构有价值。但作者因资源限制没有测试“全程单阶段 128K”的对照,因此不能单独证明阶段顺序本身优于所有等预算长上下文方案。(§3.4.1)

图 6 的数据规模曲线为:

CPT tokens 0B 15B 50B 65B 210B 315B
平均 Pass@3 54.2 58.0 59.3 61.1 61.2 62.2

早期 15B 带来较大收益,后续仍有增长但边际收益变小。65B、315B 检查点同时引入第二阶段 128K 训练,所以曲线混合了数据量和训练配方变化,不能当作只改变 token 数量的纯缩放实验。

模型规模方面,论文报告 1B、4B、30B 的平均准确率为 20.4%、32.7%、48.9%。这支持所测试范围内的规模收益,不足以建立可无条件外推的严格 scaling law。(§3.5)

辅助证据包括:同样 1,340 步 SFT-A 下,基线最终 loss 为 0.8656,315B CPT 模型为 0.7953;一般工具使用 ACEBench 从 67.2 提高到 70.0。(§3.6、表 6)前者支持后续拟合更容易,但不意味着加上 CPT 后总训练成本更低。

6. 最具创新性的点:改变经验的表示,而不只筛选经验

我认为最有辨识度的创新,是 HAS 将“只能模仿的一条历史轨迹”,改写成“有候选、有选择、有真实反馈、有最终成败的决策文本”。

普通成功轨迹 SFT 主要提高某条已完成路径的概率;丢弃失败轨迹则失去其中的信息。HAS 没有要求昂贵的分支 rollout,也没有强行制造逐步 reward,而是在保留真实响应对应关系的前提下,把局部选择空间写出来,让语言建模可以接触更多决策结构。

它与 FAS 的配合也很清楚:FAS 从廉价知识资源扩展宽度,HAS 从已有交互经验扩展决策表达,再通过 CPT 把行为学习前移。

证据强度需要分层:表 3 对“整体 Agentic CPT 有用”的支持较强;表 5 对“HAS 相比 FAS 的增量价值”提供了部分支持,但涨跌混合。论文并未证明每个合成候选都有用,也没有证明模型真正学到了可靠的反事实动作价值。

7. 不足与可能的改进

7.1 作者明确讨论的边界

论文没有独立的 limitations 专章,但正文说明了几项限制:

  • 中文检索弱于部分强基线,作者提出中文训练数据比例和 Google 搜索在中文场景的适配问题作为可能解释;这两点尚不是受控实验得出的归因。(§3.2)
  • 资源限制使得全程 128K 单阶段对照缺失。(§3.4.1)
  • 知识密集型 HLE 不只需要检索,还需要理解与推理,作者将加强知识理解列为后续方向。(§3.3)
  • GAIA 仅测试文本子集;难度 Level 3 的 Pass@1 为 50.0%,低于 Level 1 的 79.5%,复杂任务仍明显更难。(附录 B.3)

7.2 我的分析:数据便宜,不代表反馈可靠

第一,FAS 的语义正确性仍依赖过滤器。 附录 B.1 报告其规划数据在过滤后的估计准确率从 50% 提高到 82%;这不是 82% 的真实工具执行成功率。即使答案对了,也可能存在中间推理跳步、来源不支持结论等问题。

改进可以对少量、风险较高的计划做真实执行抽检,并引入逐事实来源核验。代价是增加工具和审核成本;应测保留数据的实际执行成功率、证据支持率,以及同预算下游增益,而不只看 judge 接受率。

第二,HAS 缺少未选动作的真实后果。 它扩展的是认知层面的候选集合,不是已验证的环境分支。最终 Incorrect 也不直接提供动作级负监督,数值例子已经展示这一点。

可以只对最不确定的候选做稀疏分支 rollout,再比较“原 HAS”“去掉错误轨迹选择 token 的监督”“增加可靠偏好监督”等版本。代价是额外交互和掩码设计可能损害通用语言学习;应同时测 Pass@1、动作错误率、失败恢复率及 API 成本。是否需要改损失,必须由对照实验决定。

第三,尚未彻底分离数据结构、额外计算和长上下文的贡献。 同 SFT 对照是重要证据,但还缺相同 token 或 FLOPs 预算下的通用语料 CPT、原始轨迹 CPT、FAS/HAS CPT,以及相同长度安排的比较。

改进是采用预算匹配的消融矩阵,分别控制数据格式和上下文长度。代价是训练开销高,可以先在小模型复核趋势;指标应包括准确率、每单位训练计算的增益和通用能力保留,而不只看 Agent 分数。

第四,工具栈和评测变化影响复现。 Visit 与 File Parser 使用辅助摘要能力,检索结果也会随时间变化。因此成绩属于主模型与工具系统的组合,不全是主模型参数能力。网页、离线百科和历史问答也需要严格的评测去重,但本文不能凭现有信息断言发生了数据污染。

改进是固定检索快照、辅助模型版本,公开去重规则,并提供时间切分测试。代价是离线快照可能偏离真实网络环境;可以同时报告固定环境结果和实时环境结果。

第五,多次采样和更多工具调用不是免费的能力增长。 附录 B.2 报告另一组采样设置下 BrowseComp-en 从 Pass@1 31.5% 到 Pass@16 75.8%,但它不等价于能自动识别正确答案的 75.8% 单次服务。附录 B.5 的调用次数与成功率分布也是相关性观察,不能推出“主动多调用就会变强”。

改进应增加具有实际答案选择器的 success@budget,统一 wall-clock、token 和调用预算,并报告长尾延迟。代价是必须把搜索策略与停止策略一起评估;这比只展示 oracle 式 Pass@N 更贴近部署。

7.3 复现资料的使用边界

论文指向的官方 DeepResearch 仓库提供模型入口、推理及评测相关代码。当前 README 使用 Tongyi-DeepResearch-30B-A3B 名称,并描述包含 RL 和 Heavy 推理的更完整系统。

不要直接把这个后续系统的模型、训练阶段或成绩,替换成本文 AgentFounder 的 CPT + SFT 实验。 仓库可作为工程入口;若要复现论文训练结论,仍需确认具体 checkpoint、数据配方、训练预算和评测工具版本是否对应。

8. 读者应记住的要点

  • Agentic CPT 的价值在于:后训练之前,先让基座接触足够丰富的行动与决策结构。
  • FAS 低成本扩展知识到行动的数据;HAS 扩展历史轨迹的候选表达,但保留原动作与真实反馈,不执行所有分支。
  • 主要收益由同基座、同 SFT 对照支持;HAS 的增量表现并不全涨,长上下文和计算预算也存在混杂因素。
  • 最值得继续研究的不是“能否把轨迹写得更长”,而是哪些决策结构在相同预算下真正改善选择、恢复与泛化

延伸阅读与原始资料

  1. Scaling Agents via Continual Pre-training:arXiv 摘要与版本
  2. 论文 HTML 全文:方法见 §2,控制实验和消融见表 3–5,缩放见图 6,过滤及工具分析见附录 B。
  3. 论文 PDF:可对照原始图表与脚注。
  4. 官方 DeepResearch 仓库:注意区分论文模型和后续系统。

站内相关内容:AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据 讨论如何系统合成教学数据;PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 从受控实验讨论预训练获得的规划知识与模式;Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子 将这类预训练工作放回需要训练的 Long Horizon 研究脉络。


AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据
https://kissshhot.github.io/2026/09/08/agentfounder-agentic-continual-pretraining/
作者
丁一帆
发布于
2026年9月8日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。