AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据
如果训练 Agent 总要在线搜索、访问网页、执行代码,再筛选少量成功轨迹,数据规模很快就会被环境调用成本卡住。那些没有完成任务的轨迹,以及海量没有“行动格式”的网页知识,能不能也用来训练 Agent?
AgentFounder 的答案是:先把它们改造成适合继续预训练的数据,让基座提前接触行动、决策与反馈,再做下游 SFT。 它的重点不是新的奖励函数,而是如何低成本扩大 Agent 训练数据,以及怎样使用不完美的历史经验。
本文精读 Scaling Agents via Continual Pre-training(Liangcai Su 等,Tongyi Lab;arXiv v1,2025-09-16),依据正文、附录和原始图表整理。实验分数均指论文当时的设置,不代表当前排行榜;下面的数值示例是教学构造,不是作者公开的训练样本。
1. 一句话结论与论文全景
把 Agent 的基础行为学习前移到大规模继续预训练,可以提高同一基座在多种下游 SFT 配方下的表现;关键是把无交互的知识合成和有真实反馈的轨迹复用结合起来。
论文在 Qwen3-30B-A3B-Base 上构建 AgentFounder。这里 30B-A3B 是 MoE 模型的规模标识,不是每个 token 都激活全部 30B 参数;训练数据规模则是另一个量级:正文概述约 200B + 100B tokens 的两阶段 Agentic CPT。
| 环节 | 输入 | 处理方式 | 作用 |
|---|---|---|---|
| FAS:一阶动作合成 | 网页、离线知识、历史工具结果 | 构造问题,合成下一步计划或知识推理,不执行新工具调用 | 低成本扩展基础行为和知识利用能力 |
| HAS:高阶动作合成 | 带真实工具反馈及最终成败的历史轨迹 | 每一步增加候选动作,保留原动作与原反馈,组织成选择过程 | 将已有交互经验展开为更丰富的决策文本 |
| Agentic CPT | 上述数据与知识推理语料 | 先 32K,再 128K 上下文;预测下一个 token | 提前学习 Agent 行为分布 |
| 下游 SFT | 通用指令与 Agent 示范 | 不同混合及阶段安排 | 形成最终可用的 Agent |
最有说服力的结果不是跨模型排行榜,而是同基座、同 SFT 数据的比较:使用 SFT-B 时,增加 Agentic CPT 后,BrowseComp-en 从 28.6 提高到 39.9,HLE 从 27.0 提高到 31.5,分别增加 11.3 和 4.5 个百分点。(表 3)
注意这里比较的是 “CPT 后再 SFT”与“直接 SFT”,不是 CPT 裸模型与最终 Agent,也不是一次新 RL 算法对旧 RL 算法的比较。
2. Motivation:为什么不能把一切都交给后训练?
2.1 后训练承担了两份工作
通用预训练擅长让模型获取知识和语言规律,但自然文本不一定充分包含“遇到不确定性时搜索、根据观察调整行动、失败后换路线”的交互结构。
于是 Agent 后训练同时承担两件事:一是让模型学会广泛的行动方式,二是让它对齐某套高质量示范的具体格式和策略。作者将这种负担视为瓶颈:只靠少量严格筛选的完整轨迹,既要获得行为覆盖,又要获得高质量执行,容易把模型推向特定轨迹的模仿。(§1、§2)
Agentic CPT 的研究假设是:先让基座读懂大量行动和决策经验,再做精细对齐,下游训练会更容易。 这里的 continual pre-training 指在已有基座上继续训练,不等同于持续在线学习、测试时更新参数或终身学习系统。
2.2 成功轨迹很贵,失败轨迹又不是真的毫无价值
完整 Agent 轨迹需要工具执行和环境反馈。长链任务中,即使前面十步搜索和阅读都合理,最后一步综合答案出错,也可能导致整条轨迹被拒绝采样过滤掉。
直接把它作为成功示范不对,但全部扔掉同样浪费:历史搜索结果是真实的,中间问题状态是真实的,局部决策面对的候选空间也值得学习。问题在于最终失败不能可靠告诉我们究竟哪一步错了,贸然生成逐步奖励又可能引入噪声。
因此论文选择了一条不同路线:不强行给每步打精确 reward,而是重组训练文本。 FAS 解决数据来源与规模,HAS 解决真实经验的利用方式。
3. Method:FAS、HAS 与两阶段 CPT
3.1 FAS:不执行新工具,也能合成行动训练数据
FAS 的起点不是凭空编出一条完整工具轨迹,而是已有的信息资源:高质量网页、历史搜索及访问结果、离线 Wikipedia,以及过去训练中被丢弃的材料。(§2.2、§3.1.1)
第一步:把知识整理成可出题的上下文。 作者将原始文本转为按实体组织的陈述性知识,保留时间和来源信息;这不是必须遵守固定关系模式的知识图谱。随后采样实体簇及关联事实,构造事实查询、数值问题、多跳问题或综合性问题,并关联解题所需知识。
第二步:合成 planning action。 给定问题和相关上下文,让模型生成分析,以及下一步工具调用或直接回答。生成过程中不真的调用新 API。作者还将“同一问题重复采样多次”调整为“共享知识记忆的多种问题风格”,以减少近似计划与重复问题 token。
过滤器用 LLM-as-judge 判断计划与所需知识是否对齐,例如搜索方向是否可能获取必要信息。但这只是对计划的判断,不等于已经验证搜索执行成功。
第三步:合成 reasoning action。 这是一条互补的数据生成路径,不是每条 planning action 后面都接一个工具结果:
- 先只给问题,让模型拆成子问题,利用自身知识形成初步答案 \(A_1\)。
- 再给问题对应的必要知识,让模型修正推理,得到 \(A_2\)。
- 用 judge 比较 \(A_2\) 与参考答案,保留符合条件的样本。
先不展示证据、后展示证据,是为了鼓励分析和修正,而不是一开始机械地把提供的事实抄成推理链。两步都不调用外部工具。(§2.2.3)
论文将 FAS 称为 “Zero Supervisory Signal”。准确理解是:它不依赖新生成完整交互轨迹后的环境成败监督;并非没有知识来源、参考答案、生成模型或质量过滤器。
3.2 HAS:展开决策空间,但不伪造未执行分支的反馈
设历史轨迹为:
\[ T=\{(S_1,R_1),\ldots,(S_K,R_K)\},\qquad J\in\{0,1\}. \]
\(S_k\) 是第 \(k\) 步的思考和工具调用,\(R_k\) 是对应的真实历史反馈,\(J\) 是整条轨迹最终失败或成功的标签。第 \(k\) 步已经知道的上下文是:
\[ C_k=(Q,S_1,R_1,\ldots,S_{k-1},R_{k-1}). \]
HAS 在这个上下文下离线生成 \(N\) 个额外候选思考与调用,再加入原动作 \(S_k^{(0)}=S_k\)。打乱这 \(N+1\) 个选项,记录原动作的新位置 \(n_k\)。(§2.3、图 5)
接下来合成的文本依次包含:候选选项、选择第 \(n_k\) 项的陈述、原来的真实反馈 \(R_k\)。最后追加对应 \(J\) 的 Correct / Incorrect 判断文本。
最容易误读的是:它选择的是原动作在打乱后的编号,不是执行所有分支后选出最优动作。 这样才能保证后面的真实反馈确实对应所选调用。额外候选没有被执行,因此也没有它们的真实反馈。
一条 \(K\) 步轨迹会展示:
\[ \text{候选动作总数}=(N+1)K. \]
这不是执行了 \((N+1)^K\) 条搜索路径,也不是获得了逐步最优动作标签。最终的失败标签同样不能解释为“每个中间动作都是错的”。
作者称这类文本为 Contrastive Decision-Action Synthesis,但训练目标仍是语言建模;不要因为出现 “contrastive” 就把它理解成另加了一个对比损失或偏好优化目标。
3.3 两阶段训练:先覆盖,再保留长轨迹结构
正文 §2.1 给出的整体预算是:
| 阶段 | 数据量 | 上下文长度 | 目的 |
|---|---|---|---|
| Agentic CPT Stage 1 | 约 200B tokens | 32K | 学习工具模式、基础推理与行动知识 |
| Agentic CPT Stage 2 | 100B tokens | 128K | 使用精选 Agent 数据,保留更完整的长交互结构 |
| SFT | 本文不补造未公开的精确配比 | 按论文后训练配置 | 对齐通用对话与 Agent 执行 |
后面的 scaling 实验另展示到 315B tokens 的检查点。概述中的约 300B 与 scaling 曲线的 315B 不应被强行写成完全相同的精确预算。
训练仍使用论文式 (1) 的 next-token prediction。对一段序列,其损失可写为:
\[ \mathcal L=-\sum_t\log p_\theta(x_{t+1}\mid x_{\leq t}),\qquad \mathbf p_t=\operatorname{softmax}(W_o h_t). \]
其中 \(h_t\in\mathbb R^d\) 是隐藏状态,\(W_o\in\mathbb R^{V\times d}\) 将它投影到 \(V\) 个词表项,\(\mathbf p_t\in\mathbb R^V\) 是下一个 token 的概率分布。训练的变化主要发生在模型读到什么样的序列,而不是换掉这条损失函数。
推理时,最终模型在单 Agent ReAct 框架下自主思考、调用工具并接收新反馈,不是要求用户提供 FAS 的知识答案,也不是必须先由外部生成器列出 HAS 的候选选项。
4. 具体数值例子:从知识材料到一次训练贡献
以下全部是教学用简化示例。虚构实体“星河研究所”、两个交互步骤、两个额外候选和概率值,都不是论文实际超参数或实验数据。
4.1 FAS:知识变问题,再变计划与修正推理
假设离线材料包含两条有来源的陈述:
- 星河研究所 2023 年论文数为 100 篇。
- 星河研究所 2024 年论文数为 120 篇。
将它们按实体归并后,构造问题:“星河研究所 2024 年论文数相对 2023 年增长了多少?” 同一组知识还可以生成“增加多少篇”“哪一年更多”等问题,但这些不意味着新增了独立事实。
规划样本可以是:“需要核实两年的同口径数量,下一步搜索该研究所两年的年度报告。”然后输出一个搜索调用。合成器到这里就可以结束,不真的搜索,也不编造搜索返回值。
推理样本走另一条路径:第一轮只看问题,模型可能暂时猜测增长 15%,形成 \(A_1\);第二轮看到两条已知事实,修正为:
\[ g=\frac{n_{2024}-n_{2023}}{n_{2023}} =\frac{120-100}{100}=0.20=20\%. \]
\(n_{2023}\) 和 \(n_{2024}\) 单位为篇,增长率 \(g\) 无量纲。\(A_2\) 输出“增长 20%,增加 20 篇”;judge 对照参考答案后可以保留它。第一轮猜测仅说明合成流程如何工作,并不是建议真实服务无证据时随意猜数。
4.2 HAS:原轨迹怎样展开成决策文本?
另假设历史系统曾真实运行过同一问题,留下两步成功轨迹:
| 步骤 | 原动作 \(S_k\) | 记录的真实反馈 \(R_k\) |
|---|---|---|
| 1 | 搜索研究所 2023、2024 年论文数量 | 搜索记录给出 100 篇、120 篇及来源 |
| 2 | Python 计算 print((120-100)/100) |
0.2 |
最终答案为 20%,所以 \(K=2\)、\(J=1\)。现在每步生成 \(N=2\) 个替代候选,并打乱:
| 状态 | 选项 1 | 选项 2 | 选项 3 | 保留的原动作编号 |
|---|---|---|---|---|
| \(C_1=Q\) | 未搜索直接猜测 | 搜索两年论文数(原动作) | 搜索研究所人员数量 | \(n_1=2\) |
| \(C_2=(Q,S_1,R_1)\) | Python 计算增长率(原动作) | 再搜索第三方统计 | 使用 2024 年数量作分母 | \(n_2=1\) |
候选可能优劣混杂;表中错误分母尤其说明“生成了候选”不代表“验证为正确”。HAS 的合成过程不会把选项 2 或 3 额外执行一遍再比较结果。
训练文本于是大致成为:
1 | |
这里展示了 \((2+1)\times2=6\) 个候选动作,但仍然只有原轨迹中的 2 份真实工具反馈,不是 9 条已经跑过的路径。
如果原轨迹第二步实际上用了错误分母,得到 \((120-100)/120\approx16.67\%\),HAS 会保留那个原调用和实际返回值,并在结尾记录 Incorrect;它不会事后把真实历史替换成一个虚构的正确执行。这个保真原则很重要,但也留下“错误选择会如何影响语言建模”的问题。
4.3 把 next-token 损失算一遍
真实序列包含大量 token。为便于手算,只取其中四个目标 token 位置,其预测正确 token 的概率依次为 \(0.5,0.25,0.8,0.4\)。这四项对完整训练损失的贡献为:
\[ \begin{aligned} \mathcal L_{\mathrm{4\ positions}} &=-\log0.5-\log0.25-\log0.8-\log0.4\\ &=0.6931+1.3863+0.2231+0.9163\\ &=3.2189\ \text{nats}. \end{aligned} \]
如果只平均这四项,得到 \(3.2189/4=0.8047\) nats/token。这里省略了其他 token 的损失及 Transformer 的前向计算,并不是说真实训练只监督四个位置。
再看概率 \(0.25\) 如何产生。把其中一个位置的词表简化为三个符号,对应 logits 为:
\[ z=(0,\log2,0),\qquad \operatorname{softmax}(z)=\frac{(1,2,1)}{4}=(0.25,0.5,0.25). \]
若目标恰好是第一个符号,其损失就是 \(-\log0.25=1.3863\)。交叉熵对这个目标 logit 的导数为:
\[ \frac{\partial\mathcal L}{\partial z_1}=p_1-1=0.25-1=-0.75. \]
在独立 logit 的教学近似下,用步长 \(0.1\) 做一次梯度下降,会使 \(z_1\) 增加 \(0.075\)。真实训练更新的是共享网络参数,而不是独立维护一个 logit;这个简化只用于说明梯度方向。
这揭示一个边界:结尾写 Incorrect,并不自动让前面所选动作获得负的策略梯度。 在普通 next-token 监督下,前面目标 token 的局部梯度仍推动模型预测它。模型可能通过上下文学到成败关联,但那不同于显式的逐步奖励归因,也不能直接等价为 DPO 或 RL。
5. Results:哪些证据真正支持 Agentic CPT?
5.1 先看评测条件
默认工具包括 Search、Visit、Google Scholar、Python Interpreter 和 File Parser。Search 返回每条查询的前 10 个结果;Visit 不只是下载网页,还使用摘要模型提取与目标相关的信息。(§3.1.4、附录 A.1)
AgentFounder 的推理设置为 temperature 0.85、top-p 0.95、repetition penalty 1.1,最多 128 次工具调用、128K 上下文。这里是调用上限,不是每题固定调用 128 次。
GAIA 使用 103 道文本题子集,不能写成完整多模态 GAIA 成绩。HLE 是论文的工具增强评测,不是闭卷答题。表中部分基线带有官方或其他论文来源标记,另一些由作者在统一设置下测得,因此并非所有跨模型比较都严格同工具、同预算、同评测栈。
5.2 最终模型的十项结果
| 评测 | AgentFounder-30B | 解读 |
|---|---|---|
| BrowseComp-en | 39.9 | 复杂英文检索 |
| BrowseComp-zh | 43.3 | 中文检索仍有明显差距 |
| GAIA 文本子集 | 72.8 | 不是完整 GAIA |
| Xbench-DeepSearch | 73.0 | 深度搜索任务 |
| WebWalkerQA | 71.9 | 网页浏览问答 |
| HLE Pass@1 | 31.5 | 工具增强的高难问题 |
| DeepResearch Bench | 47.9 | RACE Overall 评分,不是简单答对率 |
| Frames Pass@1 | 89.6 | 多跳检索与证据综合 |
| SEAL-0 Pass@1 | 43.9 | 干扰信息下的鲁棒性 |
| AcademicBrowse Pass@1 | 75.3 | 学术检索任务 |
来源为表 1、表 2;除特别标出的评分外,按论文的百分制表现报告。不能据此声称所有任务全面领先:BrowseComp-zh 中 DeepSeek-V3.1 为 49.2,高于 43.3;OpenAI-o3 在 BrowseComp-en、zh 分别为 49.7、58.1;Gemini Deep Research 的 RACE Overall 为 49.7,也高于 47.9。
这些结果说明当时的整体系统竞争力较强,但跨模型领先不能单独证明是 CPT 某一个模块造成的。
5.3 同基座、同 SFT:更直接的有效性证据
SFT-A 先通用对话再专项 ReAct;SFT-B 在两个阶段都混合通用与 ReAct 数据;SFT-C 使用通用数据及带精简推理的 ReAct 轨迹。固定每种 SFT 配方,比较是否增加 CPT,得到:(表 3)
| 后训练 | 基座 | BC-en | BC-zh | GAIA | HLE |
|---|---|---|---|---|---|
| SFT-A | 原 Qwen 基座 | 26.9 | 29.8 | 67.0 | 23.5 |
| SFT-A | AgentFounder 基座 | 31.4 | 35.6 | 72.8 | 30.4 |
| SFT-B | 原 Qwen 基座 | 28.6 | 35.6 | 71.8 | 27.0 |
| SFT-B | AgentFounder 基座 | 39.9 | 43.3 | 72.8 | 31.5 |
| SFT-C | 原 Qwen 基座 | 24.5 | 36.7 | 68.9 | 27.9 |
| SFT-C | AgentFounder 基座 | 38.8 | 44.3 | 71.8 | 28.9 |
三个配方的四项平均绝对增益分别约为 5.75、6.13、6.45 个百分点。原表把差值标作 Relative Δ,但展示的是百分点差,不是相对增长百分比。例如 SFT-B 的 BC-en 相对增长为 \((39.9-28.6)/28.6\approx39.5\%\),绝对提升才是 11.3 个百分点。
这支持 CPT 的收益不依赖唯一的 SFT 配方。不过它不是等总计算量实验:CPT 组额外用了大量训练 token,不能据此断言 Agentic 数据比同预算所有其他数据都更有效。
5.4 FAS 有效,但 HAS 不是每个指标都涨
表 5 使用约 50B tokens 的单阶段训练,再接 SFT-A:
| CPT 数据 | BC-en @1 / @3 | BC-zh @1 / @3 | GAIA @1 / @3 |
|---|---|---|---|
| 无 CPT | 26.9 / 38.0 | 29.8 / 45.3 | 67.0 / 75.7 |
| FAS | 31.4 / 49.9 | 37.0 / 54.3 | 72.8 / 80.6 |
| FAS + HAS | 31.4 / 50.1 | 40.1 / 54.7 | 69.9 / 82.5 |
只用 FAS 已经明显优于无 CPT。加入 HAS 后,BC-zh Pass@1 增加 3.1 个百分点,GAIA Pass@3 增加 1.9,但 GAIA Pass@1 下降 2.9,BC-en Pass@1 不变。
作者将 GAIA 的下降解释为评测波动。我的判断是:没有重复训练的置信区间,尚不能确认它只是噪声;更稳妥的结论是 HAS 有互补收益,但并非所有指标一致提升。 Pass@3 也不是单次部署准确率,它衡量多次采样中至少一次成功的能力。
5.5 长上下文与规模:有效趋势,不是无限外推定律
表 4 将训练 token 固定为 50B,并使用 SFT-A。与只用第一阶段相比,两阶段的 BC-en、BC-zh、GAIA Pass@1 分别从 31.4、34.3、69.9 提高到 35.5、37.2、72.8,平均提高 3.3 个百分点。
这说明保留完整长轨迹结构有价值。但作者因资源限制没有测试“全程单阶段 128K”的对照,因此不能单独证明阶段顺序本身优于所有等预算长上下文方案。(§3.4.1)
图 6 的数据规模曲线为:
| CPT tokens | 0B | 15B | 50B | 65B | 210B | 315B |
|---|---|---|---|---|---|---|
| 平均 Pass@3 | 54.2 | 58.0 | 59.3 | 61.1 | 61.2 | 62.2 |
早期 15B 带来较大收益,后续仍有增长但边际收益变小。65B、315B 检查点同时引入第二阶段 128K 训练,所以曲线混合了数据量和训练配方变化,不能当作只改变 token 数量的纯缩放实验。
模型规模方面,论文报告 1B、4B、30B 的平均准确率为 20.4%、32.7%、48.9%。这支持所测试范围内的规模收益,不足以建立可无条件外推的严格 scaling law。(§3.5)
辅助证据包括:同样 1,340 步 SFT-A 下,基线最终 loss 为 0.8656,315B CPT 模型为 0.7953;一般工具使用 ACEBench 从 67.2 提高到 70.0。(§3.6、表 6)前者支持后续拟合更容易,但不意味着加上 CPT 后总训练成本更低。
6. 最具创新性的点:改变经验的表示,而不只筛选经验
我认为最有辨识度的创新,是 HAS 将“只能模仿的一条历史轨迹”,改写成“有候选、有选择、有真实反馈、有最终成败的决策文本”。
普通成功轨迹 SFT 主要提高某条已完成路径的概率;丢弃失败轨迹则失去其中的信息。HAS 没有要求昂贵的分支 rollout,也没有强行制造逐步 reward,而是在保留真实响应对应关系的前提下,把局部选择空间写出来,让语言建模可以接触更多决策结构。
它与 FAS 的配合也很清楚:FAS 从廉价知识资源扩展宽度,HAS 从已有交互经验扩展决策表达,再通过 CPT 把行为学习前移。
证据强度需要分层:表 3 对“整体 Agentic CPT 有用”的支持较强;表 5 对“HAS 相比 FAS 的增量价值”提供了部分支持,但涨跌混合。论文并未证明每个合成候选都有用,也没有证明模型真正学到了可靠的反事实动作价值。
7. 不足与可能的改进
7.1 作者明确讨论的边界
论文没有独立的 limitations 专章,但正文说明了几项限制:
- 中文检索弱于部分强基线,作者提出中文训练数据比例和 Google 搜索在中文场景的适配问题作为可能解释;这两点尚不是受控实验得出的归因。(§3.2)
- 资源限制使得全程 128K 单阶段对照缺失。(§3.4.1)
- 知识密集型 HLE 不只需要检索,还需要理解与推理,作者将加强知识理解列为后续方向。(§3.3)
- GAIA 仅测试文本子集;难度 Level 3 的 Pass@1 为 50.0%,低于 Level 1 的 79.5%,复杂任务仍明显更难。(附录 B.3)
7.2 我的分析:数据便宜,不代表反馈可靠
第一,FAS 的语义正确性仍依赖过滤器。 附录 B.1 报告其规划数据在过滤后的估计准确率从 50% 提高到 82%;这不是 82% 的真实工具执行成功率。即使答案对了,也可能存在中间推理跳步、来源不支持结论等问题。
改进可以对少量、风险较高的计划做真实执行抽检,并引入逐事实来源核验。代价是增加工具和审核成本;应测保留数据的实际执行成功率、证据支持率,以及同预算下游增益,而不只看 judge 接受率。
第二,HAS 缺少未选动作的真实后果。 它扩展的是认知层面的候选集合,不是已验证的环境分支。最终 Incorrect 也不直接提供动作级负监督,数值例子已经展示这一点。
可以只对最不确定的候选做稀疏分支 rollout,再比较“原 HAS”“去掉错误轨迹选择 token 的监督”“增加可靠偏好监督”等版本。代价是额外交互和掩码设计可能损害通用语言学习;应同时测 Pass@1、动作错误率、失败恢复率及 API 成本。是否需要改损失,必须由对照实验决定。
第三,尚未彻底分离数据结构、额外计算和长上下文的贡献。 同 SFT 对照是重要证据,但还缺相同 token 或 FLOPs 预算下的通用语料 CPT、原始轨迹 CPT、FAS/HAS CPT,以及相同长度安排的比较。
改进是采用预算匹配的消融矩阵,分别控制数据格式和上下文长度。代价是训练开销高,可以先在小模型复核趋势;指标应包括准确率、每单位训练计算的增益和通用能力保留,而不只看 Agent 分数。
第四,工具栈和评测变化影响复现。 Visit 与 File Parser 使用辅助摘要能力,检索结果也会随时间变化。因此成绩属于主模型与工具系统的组合,不全是主模型参数能力。网页、离线百科和历史问答也需要严格的评测去重,但本文不能凭现有信息断言发生了数据污染。
改进是固定检索快照、辅助模型版本,公开去重规则,并提供时间切分测试。代价是离线快照可能偏离真实网络环境;可以同时报告固定环境结果和实时环境结果。
第五,多次采样和更多工具调用不是免费的能力增长。 附录 B.2 报告另一组采样设置下 BrowseComp-en 从 Pass@1 31.5% 到 Pass@16 75.8%,但它不等价于能自动识别正确答案的 75.8% 单次服务。附录 B.5 的调用次数与成功率分布也是相关性观察,不能推出“主动多调用就会变强”。
改进应增加具有实际答案选择器的 success@budget,统一 wall-clock、token 和调用预算,并报告长尾延迟。代价是必须把搜索策略与停止策略一起评估;这比只展示 oracle 式 Pass@N 更贴近部署。
7.3 复现资料的使用边界
论文指向的官方 DeepResearch 仓库提供模型入口、推理及评测相关代码。当前 README 使用 Tongyi-DeepResearch-30B-A3B 名称,并描述包含 RL 和 Heavy 推理的更完整系统。
不要直接把这个后续系统的模型、训练阶段或成绩,替换成本文 AgentFounder 的 CPT + SFT 实验。 仓库可作为工程入口;若要复现论文训练结论,仍需确认具体 checkpoint、数据配方、训练预算和评测工具版本是否对应。
8. 读者应记住的要点
- Agentic CPT 的价值在于:后训练之前,先让基座接触足够丰富的行动与决策结构。
- FAS 低成本扩展知识到行动的数据;HAS 扩展历史轨迹的候选表达,但保留原动作与真实反馈,不执行所有分支。
- 主要收益由同基座、同 SFT 对照支持;HAS 的增量表现并不全涨,长上下文和计算预算也存在混杂因素。
- 最值得继续研究的不是“能否把轨迹写得更长”,而是哪些决策结构在相同预算下真正改善选择、恢复与泛化。
延伸阅读与原始资料
- Scaling Agents via Continual Pre-training:arXiv 摘要与版本。
- 论文 HTML 全文:方法见 §2,控制实验和消融见表 3–5,缩放见图 6,过滤及工具分析见附录 B。
- 论文 PDF:可对照原始图表与脚注。
- 官方 DeepResearch 仓库:注意区分论文模型和后续系统。
站内相关内容:AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据 讨论如何系统合成教学数据;PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 从受控实验讨论预训练获得的规划知识与模式;Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子 将这类预训练工作放回需要训练的 Long Horizon 研究脉络。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。