论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理
原论文:GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
作者:GLM-4.5 Team(智谱AI团队,共170位作者)
发布时间:2025 年 8 月
引言
GLM-4.5 是智谱AI(Zhipu AI)发布的开源MoE大模型,拥有 355B 总参数 / 32B 激活参数(Air版为106B/12B)。它在Agentic、推理和编程三大领域都取得了顶尖表现——TAU-Bench 70.1%(第2名)、SWE-bench Verified 64.2%(第3名),且参数规模仅为 DeepSeek-R1 的一半。
本文将深入解析 GLM-4.5 的后训练(Post-Training)设计,特别是其创新的专家模型迭代(Expert Model Iteration)范式。
后训练两阶段范式概览
与 Kimi K3 的三阶段不同,GLM-4.5 采用更简洁的两阶段后训练架构:
1 | |
Stage 1: 专家模型训练
SFT:不仅是冷启动
GLM-4.5 的 SFT 在不同阶段承担不同角色:
| 阶段 | SFT 目标 | 关键技术 |
|---|---|---|
| Expert Training | Cold Start - 提供基础对话、推理和工具使用能力 | 扩展 CoT、拒采样、Response Scaling |
| Unified Training | 蒸馏多个专家模型能力到单一混合推理通才 | 自蒸馏、混合推理模板 |
SFT 关键技术细节
1. Cold Start SFT - 小规模数据集,包含扩展的思维链(Chain-of-Thought)响应 - 为 RL 训练提供基础策略
2. 拒采样(Rejection Sampling)多阶段过滤
1
原始样本 → 过滤重复/过短/截断样本 → 验证正确性 → 奖励模型打分 → 保留高质量样本
3. Prompt 选择与 Response Scaling
| 技术 | 效果 |
|---|---|
| 按响应长度筛选(移除底部50%) | 数学/科学任务提升 2-4% |
| 困难 Prompt 生成4个响应 | 额外提升 1-2% |
4. XML 函数调用模板(创新点)
GLM-4.5 设计了类 XML 的特殊token标签来替代 JSON 转义,减少代码中的字符转义问题:
1 | |
Stage 1: 领域专属 RL
GLM-4.5 的 RL 基于 GRPO 框架(去除 KL 散度项),针对不同领域设计了专门的训练策略。
推理 RL(Reasoning RL)
1 | |
关键发现:单阶段 64K RL
传统做法是多阶段逐步增加最大输出长度(4K → 8K → 16K → 32K → 64K),但 GLM-4.5 发现这会导致不可逆的性能下降。相反,直接进行 64K 输出的单阶段 RL 能够持续推动模型极限。
动态温度采样策略: - 当 rollout 的平均奖励趋于稳定时,提升采样温度 - 选择 validation 性能下降不超过 1% 的最大温度
代码 RL(Code RL)
| 优化点 | 传统方法 | GLM-4.5 改进 |
|---|---|---|
| 损失计算 | Sequence-mean | Token-weighted mean loss |
| 效果 | 收敛慢、长度偏差 | 收敛更快、减少长度偏见 |
科学 RL(Science RL)
- 数据选择:仅使用专家验证的多选题(exclusively expert-verified multiple-choice questions)
- 发现:高质量纯数据优于混合质量数据
Stage 1: Agentic RL
结果监督 + 过程格式惩罚
1 | |
严格的格式要求:如果模型未能产生正确的工具调用格式,奖励直接归零。
迭代蒸馏(Iterative Distillation)
1 | |
测试时计算扩展
GLM-4.5 发现:Agent 任务的准确率通过环境交互回合数可以平滑地扩展——这是智能体能力的关键指标。
Stage 1: 通用 RL
| 维度 | 方法 |
|---|---|
| Holistic RL | ~5,000 prompts,7/33/139 三级分类,人工+AI反馈 |
| 指令遵循 RL | 7大/151小约束类型,确定性规则+奖励模型+批判模型 |
| 函数调用 RL | 逐步规则验证 + 端到端多轮 RL |
| Pathology RL | 针对性数据集解决语言混合、过度重复、格式错误 |
Stage 2: 统一训练与混合推理
核心目标
将 Stage 1 训练的三个领域专家(推理、Agent、通用)通过自蒸馏整合为单一模型,并支持混合推理模式。
三种思考模式
GLM-4.5 实现了精细化的推理控制:
| 模式 | 说明 |
|---|---|
| Interleaved Thinking (默认) | 每轮响应前都思考,每次工具调用前也思考 |
| Preserved Thinking | 多轮对话中保留思维块,保持上下文连贯 |
| Turn-level Thinking | 每轮可独立控制是否开启推理 |
Hybrid Reasoning 实现
1 | |
RL 基础设施:Slime
GLM-4.5 自研的 RL 训练基础设施支持两种模式:
| 模式 | 适用场景 | 特点 |
|---|---|---|
| 同步模式 | 数学/代码任务 | 训练和推理同机部署 |
| 异步模式 | Agent 任务 | 解耦部署,支持长时间交互 |
FP8 推理加速:在线、分块 FP8 量化,加速 rollout 生成。
与相关工作对比
| 维度 | GLM-4.5 | Kimi K3 | DeepSeek-R1 |
|---|---|---|---|
| 总参数量 | 355B (32B激活) | 2.8T (104B激活) | 671B (37B激活) |
| 后训练阶段 | 2 阶段 | 3 阶段 | 2 阶段 |
| 专家模型 | 3 领域专家 + 自蒸馏 | 9 专家 + MOPD 蒸馏 | 单一模型 |
| RL 输出长度 | 单阶段 64K | Partial Rollout | 渐进式 |
| 推理模式 | Hybrid (显式控制) | 3档努力级别 | 隐式 |
| 函数调用格式 | XML 标签 | XTML | JSON |
关键洞见与启发
1. 专家模型迭代的范式
GLM-4.5 展示了一条与 Kimi K3 不同的路径: - 先专家化:分别训练推理、Agent、通用三个专家 - 后统一化:通过自蒸馏整合为单一混合推理模型 - 用户透明:最终用户只需要与一个模型交互
2. 单阶段长输出 RL
打破常规认知: > “多阶段逐步增加输出长度会导致不可逆的性能下降”
直接进行 64K 输出的单阶段 RL 反而能持续突破模型极限。
3. 严格的格式奖励
Agentic RL 中,将格式正确性作为硬性门槛(格式错误=零奖励),强迫模型学习正确的工具使用模式。
4. 混合推理的工程实现
通过系统提示词级别的控制(system-level thinking/non-thinking toggle),而非复杂的 token 预算计算,实现灵活的推理模式切换。
总结
GLM-4.5 的后训练设计体现了以下核心思想:
两阶段简洁架构:Expert Training → Unified Training,清晰分离专业化和统一化
专家模型迭代:先训练领域专家,再自蒸馏整合,兼顾专业深度和通用广度
混合推理:通过系统提示词控制 thinking/non-thinking 模式,用户可灵活选择
单阶段长输出 RL:直接 64K 输出训练,避免渐进式长度扩展的性能损失
严格的格式约束:Agentic RL 中格式正确性是奖励的必要条件
GLM-4.5 以一半于 DeepSeek-R1 的参数规模达到了相近甚至更优的 Agentic 和推理能力,证明了高效后训练流程的重要性。
参考资料
- GLM-4.5 技术报告
- GLM-4.5 GitHub
- Kimi K3 技术报告(对比参考)
- DeepSeek-R1 技术报告(对比参考)
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。