论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理

原论文:GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
作者:GLM-4.5 Team(智谱AI团队,共170位作者)
发布时间:2025 年 8 月

引言

GLM-4.5 是智谱AI(Zhipu AI)发布的开源MoE大模型,拥有 355B 总参数 / 32B 激活参数(Air版为106B/12B)。它在Agentic、推理和编程三大领域都取得了顶尖表现——TAU-Bench 70.1%(第2名)、SWE-bench Verified 64.2%(第3名),且参数规模仅为 DeepSeek-R1 的一半。

本文将深入解析 GLM-4.5 的后训练(Post-Training)设计,特别是其创新的专家模型迭代(Expert Model Iteration)范式。


后训练两阶段范式概览

与 Kimi K3 的三阶段不同,GLM-4.5 采用更简洁的两阶段后训练架构

1
2
3
4
5
6
7
8
9
10
11
12
13
┌─────────────────────────────────────────────────────────────────┐
│ Post-Training Pipeline │
├─────────────────────────────────────────────────────────────────┤
│ Stage 1: Expert Training (专家训练)
│ ├─ 三个领域专家:推理(Reasoning) + 智能体(Agent) + 通用对话 │
│ ├─ SFT Cold Start:基础能力与工具使用 │
│ └─ 领域专属 RL:GRPO + 课程学习 + 64K 输出长度 │
├─────────────────────────────────────────────────────────────────┤
│ Stage 2: Unified Training (统一训练)
│ ├─ 自蒸馏:将多个专家能力整合到单一混合推理模型 │
│ ├─ Hybrid Reasoning:思考模式(thinking) + 直接模式(non-thinking) │
│ └─ Interleaved Thinking:每轮都思考,工具调用前也思考 │
└─────────────────────────────────────────────────────────────────┘

Stage 1: 专家模型训练

SFT:不仅是冷启动

GLM-4.5 的 SFT 在不同阶段承担不同角色:

阶段 SFT 目标 关键技术
Expert Training Cold Start - 提供基础对话、推理和工具使用能力 扩展 CoT、拒采样、Response Scaling
Unified Training 蒸馏多个专家模型能力到单一混合推理通才 自蒸馏、混合推理模板

SFT 关键技术细节

1. Cold Start SFT - 小规模数据集,包含扩展的思维链(Chain-of-Thought)响应 - 为 RL 训练提供基础策略

2. 拒采样(Rejection Sampling)多阶段过滤

1
原始样本 → 过滤重复/过短/截断样本 → 验证正确性 → 奖励模型打分 → 保留高质量样本

3. Prompt 选择与 Response Scaling

技术 效果
按响应长度筛选(移除底部50%) 数学/科学任务提升 2-4%
困难 Prompt 生成4个响应 额外提升 1-2%

4. XML 函数调用模板(创新点)

GLM-4.5 设计了类 XML 的特殊token标签来替代 JSON 转义,减少代码中的字符转义问题:

1
2
3
4
5
6
7
8
9
<!-- 传统 JSON 格式 -->
{"tool": "search", "query": "quantum computing"}

<!-- GLM-4.5 XML 模板 -->
<tool_call>
<tool>search</tool>
<arg_key>query</arg_key>
<arg_value>quantum computing</arg_value>
</tool_call>

Stage 1: 领域专属 RL

GLM-4.5 的 RL 基于 GRPO 框架(去除 KL 散度项),针对不同领域设计了专门的训练策略。

推理 RL(Reasoning RL)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
┌─────────────────────────────────────────────────────────────┐
│ Reasoning RL Training Pipeline │
├─────────────────────────────────────────────────────────────┤
│ │
│ ┌─────────────────┐ ┌─────────────────────────────┐ │
│ │ 课程学习策略 │ → │ Stage 1: 中等难度问题 │ │
│ │ (Difficulty- │ │ Stage 2: 极难问题 │ │
│ │ based) │ │ (pass@8==0, pass@512>>0) │ │
│ └─────────────────┘ └─────────────────────────────┘ │
│ │ │
│ ▼ │
│ ┌─────────────────┐ ┌─────────────────────────────┐ │
│ │ 单阶段 64K RL │ │ 多阶段长度递增 → 性能不可逆 │ │
│ │ (关键创新!) │ vs │ 单阶段直接 64K → 持续突破 │ │
│ └─────────────────┘ └─────────────────────────────┘ │
│ │ │
│ ▼ │
│ ┌─────────────────┐ │
│ │ 动态温度采样 │ │ 奖励稳定时提升 temperature │ │
│ │ │ │ 选择 validation 下降<1% 的max │ │
│ └─────────────────┘ │
└─────────────────────────────────────────────────────────────┘

关键发现:单阶段 64K RL

传统做法是多阶段逐步增加最大输出长度(4K → 8K → 16K → 32K → 64K),但 GLM-4.5 发现这会导致不可逆的性能下降。相反,直接进行 64K 输出的单阶段 RL 能够持续推动模型极限

动态温度采样策略: - 当 rollout 的平均奖励趋于稳定时,提升采样温度 - 选择 validation 性能下降不超过 1% 的最大温度

代码 RL(Code RL)

优化点 传统方法 GLM-4.5 改进
损失计算 Sequence-mean Token-weighted mean loss
效果 收敛慢、长度偏差 收敛更快、减少长度偏见

科学 RL(Science RL)

  • 数据选择:仅使用专家验证的多选题(exclusively expert-verified multiple-choice questions)
  • 发现:高质量纯数据优于混合质量数据

Stage 1: Agentic RL

结果监督 + 过程格式惩罚

1
2
3
4
5
Reward = {
1.0 如果最终答案正确且格式正确
0.0 如果格式错误(即使答案正确)
0.0 如果答案错误
}

严格的格式要求:如果模型未能产生正确的工具调用格式,奖励直接归零。

迭代蒸馏(Iterative Distillation)

1
2
3
4
5
6
7
8
┌─────────────┐     ┌─────────────┐     ┌─────────────┐
│ RL Train │ --> │ Self-Distill│ --> │ RL Train │
│ (Round 1) │ │ to SFT │ │ (Round 2) │
└─────────────┘ └─────────────┘ └─────────────┘
│ │
└────────────────────────────────────────┘

增加难度,循环迭代

测试时计算扩展

GLM-4.5 发现:Agent 任务的准确率通过环境交互回合数可以平滑地扩展——这是智能体能力的关键指标。


Stage 1: 通用 RL

维度 方法
Holistic RL ~5,000 prompts,7/33/139 三级分类,人工+AI反馈
指令遵循 RL 7大/151小约束类型,确定性规则+奖励模型+批判模型
函数调用 RL 逐步规则验证 + 端到端多轮 RL
Pathology RL 针对性数据集解决语言混合、过度重复、格式错误

Stage 2: 统一训练与混合推理

核心目标

将 Stage 1 训练的三个领域专家(推理、Agent、通用)通过自蒸馏整合为单一模型,并支持混合推理模式

三种思考模式

GLM-4.5 实现了精细化的推理控制:

模式 说明
Interleaved Thinking (默认) 每轮响应前都思考,每次工具调用前也思考
Preserved Thinking 多轮对话中保留思维块,保持上下文连贯
Turn-level Thinking 每轮可独立控制是否开启推理

Hybrid Reasoning 实现

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
┌─────────────────────────────────────────────────────────────┐
│ Hybrid Reasoning │
├─────────────────────────────────────────────────────────────┤
│ │
│ Input Prompt │
│ │ │
│ ▼ │
│ ┌─────────────────────────────────────────┐ │
│ │ User specifies: thinking / non-thinking │ │
│ └─────────────────────────────────────────┘ │
│ │ │
│ ├── thinking ──► 激活推理专家能力 ──► 深度思考输出 │
│ │ │
│ └── non-thinking ──► 直接响应模式 ──► 快速输出 │
│ │
└─────────────────────────────────────────────────────────────┘

RL 基础设施:Slime

GLM-4.5 自研的 RL 训练基础设施支持两种模式:

模式 适用场景 特点
同步模式 数学/代码任务 训练和推理同机部署
异步模式 Agent 任务 解耦部署,支持长时间交互

FP8 推理加速:在线、分块 FP8 量化,加速 rollout 生成。


与相关工作对比

维度 GLM-4.5 Kimi K3 DeepSeek-R1
总参数量 355B (32B激活) 2.8T (104B激活) 671B (37B激活)
后训练阶段 2 阶段 3 阶段 2 阶段
专家模型 3 领域专家 + 自蒸馏 9 专家 + MOPD 蒸馏 单一模型
RL 输出长度 单阶段 64K Partial Rollout 渐进式
推理模式 Hybrid (显式控制) 3档努力级别 隐式
函数调用格式 XML 标签 XTML JSON

关键洞见与启发

1. 专家模型迭代的范式

GLM-4.5 展示了一条与 Kimi K3 不同的路径: - 先专家化:分别训练推理、Agent、通用三个专家 - 后统一化:通过自蒸馏整合为单一混合推理模型 - 用户透明:最终用户只需要与一个模型交互

2. 单阶段长输出 RL

打破常规认知: > “多阶段逐步增加输出长度会导致不可逆的性能下降”

直接进行 64K 输出的单阶段 RL 反而能持续突破模型极限。

3. 严格的格式奖励

Agentic RL 中,将格式正确性作为硬性门槛(格式错误=零奖励),强迫模型学习正确的工具使用模式。

4. 混合推理的工程实现

通过系统提示词级别的控制(system-level thinking/non-thinking toggle),而非复杂的 token 预算计算,实现灵活的推理模式切换。


总结

GLM-4.5 的后训练设计体现了以下核心思想:

  1. 两阶段简洁架构:Expert Training → Unified Training,清晰分离专业化和统一化

  2. 专家模型迭代:先训练领域专家,再自蒸馏整合,兼顾专业深度和通用广度

  3. 混合推理:通过系统提示词控制 thinking/non-thinking 模式,用户可灵活选择

  4. 单阶段长输出 RL:直接 64K 输出训练,避免渐进式长度扩展的性能损失

  5. 严格的格式约束:Agentic RL 中格式正确性是奖励的必要条件

GLM-4.5 以一半于 DeepSeek-R1 的参数规模达到了相近甚至更优的 Agentic 和推理能力,证明了高效后训练流程的重要性。


参考资料


论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理
https://kissshhot.github.io/2026/08/17/glm-4.5-post-training/
作者
丁一帆
发布于
2026年8月17日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。