论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习

原论文:Kimi K3: Open Frontier Intelligence
作者:Kimi Team
发布时间:2026 年 7 月

引言

Kimi K3 是 Moonshot AI 发布的 2.8T 参数 MoE 大模型,拥有 1040 亿激活参数、原生视觉能力和 100 万 token 上下文窗口。在这篇技术报告中,后训练(Post-Training)阶段的设计尤其值得关注——它采用了三阶段范式,通过跨通用、Agentic、编程三大领域的强化学习,结合多推理努力级别的训练策略,实现了组合泛化与鲁棒的长程执行能力。

本文将详细拆解 Kimi K3 的后训练流程。


后训练三阶段范式概览

Kimi K3 的后训练遵循以下三阶段架构:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
┌─────────────────────────────────────────────────────────────────┐
│ Post-Training Pipeline │
├─────────────────────────────────────────────────────────────────┤
│ Stage 1: SFT │
│ ├─ 建立高质量的冷启动策略 │
│ ├─ 扩展复杂 Agentic 任务覆盖 │
│ └─ XTML 格式序列化 + 量化感知训练 │
├─────────────────────────────────────────────────────────────────┤
│ Stage 2: Reinforcement Learning │
│ ├─ 三大领域专家模型训练 │
│ │ ├─ 通用任务 (General) │
│ │ ├─ 通用智能体 (General Agents) │
│ │ └─ 编程智能体 (Coding Agents) │
│ ├─ 三档推理努力级别: low / high / max │
│ └─ 共 9 个领域专家模型 │
├─────────────────────────────────────────────────────────────────┤
│ Stage 3: MOPD (Multi-Teacher On-Policy Distillation) │
│ ├─ 将 9 个领域专家整合为单一模型 │
│ ├─ 跨领域能力迁移 │
│ └─ 支持动态推理努力级别选择 │
└─────────────────────────────────────────────────────────────────┘

Stage 1: 监督微调 (SFT)

核心目标

SFT 阶段的核心任务是建立一个高质量的冷启动策略,为后续的 RL 训练奠定基础。

关键设计

设计点 说明
数据合成 使用 Kimi 系列领域专用模型合成数据轨迹
验证流程 多阶段验证 + 人工在环标注
序列化格式 XTML (eXtensible Token Markup Language) 统一表示复杂 Agentic 轨迹
量化感知训练 从 SFT 阶段开始使用 MXFP4 权重 + MXFP8 激活

XTML 的作用

XTML 是 Kimi K3 设计的基于 token 的聊天模板,用于一致地表示复杂的 Agentic 交互轨迹。这种格式化的优势在于:

  • 支持自适应推理的显式表达
  • 统一工具调用的序列化方式
  • 保留长程执行的完整上下文

Stage 2: 强化学习 (RL)

这是 Kimi K3 后训练的核心创新所在。与为单个任务训练专用 RL 模型的传统做法不同,Kimi K3 采用跨领域规模化 RL策略。

三大训练领域

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
┌──────────────────────────────────────────────────────────────┐
RL Training Domains
├──────────────────────────────────────────────────────────────┤
│ │
│ ┌─────────────────┐ ┌─────────────────┐ ┌───────────────┐ │
│ │ General Tasks │ │ General Agents │ │ Coding Agents │ │
│ │ 通用任务 │ │ 通用智能体 │ │ 编程智能体 │ │
│ ├─────────────────┤ ├─────────────────┤ ├───────────────┤ │
│ │ • 通用经验 │ │ • 长程助手任务 │ │ • 软件工程(SWE)│ │
│ │ • 视觉能力 │ │ • 深度研究 │ │ • 编程体验 │ │
│ │ • 推理能力 │ │ • 段落级写作 │ │ • 内核优化 │ │
│ │ • 忠实度 │ │ │ │ • Web 开发 │ │
│ │ • 搜索能力 │ │ │ │ │ │
│ │ • 知识工作 │ │ │ │ │ │
│ └─────────────────┘ └─────────────────┘ └───────────────┘ │
│ │
│ × 三种推理努力级别: lowhighmax
│ │
= 9 个专家模型 (3 领域 × 3 级别)
└──────────────────────────────────────────────────────────────┘

Partial Rollout:解决长程任务延迟问题

对于长程 Agentic 任务,轨迹完成时间差异巨大(长尾延迟)。Kimi K3 采用 Partial Rollout 方案:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
# 概念示意
# 传统 RL:等待所有 N×K 条轨迹完成才能更新
# Partial Rollout:只要 λ 比例的轨迹完成就开始优化

while training:
# 采样 N 个 prompt,每个生成 K 个 completion
active_workload = N * K # 当前活跃的轨迹数

# 不等待全部完成,只要 λ 比例完成就开始
if completed_trajectories >= λ * N * K:
# 暂停未完成的 rollout
pause_incomplete_rollouts()

# 执行策略优化(使用已完成的轨迹)
policy_update()

# 将暂停的轨迹加入队列,下一轮优先恢复
enqueue_paused_rollouts()

关键设计: - 单条长程轨迹可以跨多个迭代完成 - 引入数据陈旧性(off-policy)但通过 per-token regularization 保持稳定性 - 沙箱基础设施支持轨迹状态的持久化与恢复

推理努力级别控制 (Reasoning Effort RL)

这是 Kimi K3 的重要创新——通过 token 预算控制实现可调的推理努力级别

预算控制机制

对于每个问题 \(x\): - 设定初始 token 预算 \(b_0(x)\)(从冷启动模型估计) - 设定预算乘数阈值 \(\tau\) - 如果轨迹总 token 数 \(T(y) > \tau \cdot b_0(x)\),奖励设为 -1(惩罚)

训练课程

阶段 预算乘数 τ 目标
第一阶段 较大值 训练 max-budget 专家(高推理能力)
第二阶段 中等值 退火得到 high 努力级别
第三阶段 较小值 得到 low 努力级别

不同任务的 token 计量方式: - 通用任务:只计算 thinking tokens - Agentic 任务:计算累计输出 tokens(推理 + 工具调用参数)

Agentic 生成式奖励模型 (Agentic GRM)

对于非可验证的通用任务,Kimi K3 使用 Agentic GRM 进行评判:

评判协议(必须遵循的 4 步流程): 1. 读取输出/产物/文本 2. 生成评分标准 (rubric) 3. 对照标准给每个候选打分 4. 记录分数到评分表

防 Reward Hacking: - 设定输出长度预算 \(\ell_0\) 和乘数 \(\sigma\) - 输出长度超过 \(\sigma \cdot \ell_0\) 的候选自动判负


Stage 3: 多教师在线策略蒸馏 (MOPD)

核心目标

将 9 个领域专家(3 领域 × 3 推理级别)的能力整合到单一模型中。

OPD 奖励函数

对于领域 \(d\) 和推理努力级别 \(e\),OPD 奖励定义为:

\[r^{d}_{\text{opd}}(y_t \mid e, x, y_{<t}) = \text{clip}\left(\text{sg}\left(\log \frac{\pi_{\text{teacher}}^{(d,e)}(y_t \mid x, y_{<t})}{\pi_{\theta}(y_t \mid e, x, y_{<t})}\right), -R_{\max}, R_{\max}\right)\]

其中: - \(\text{sg}(\cdot)\) 是 stop-gradient 算子 - \(R_{\max}\) 是裁剪阈值,防止极端优势信号

MOPD 的优势

  1. 密集奖励信号:每个 token 都有梯度信号
  2. 基础设施兼容:天然支持 partial rollout
  3. 灵活的专家选择:训练时可采样不同的 (domain, effort) 组合

部署感知后训练 (Deployment-Aware Post-Training)

MXFP4 量化感知训练

组件 精度
MoE Expert 权重 MXFP4
Expert 输入激活 MXFP8
非 Expert 组件 (Attention, Router 等) 高精度

关键设计: - 整个后训练阶段(SFT + RL)都使用 QAT - Rollout 和训练共享相同的量化方案 - 消除训练-推理不匹配

Draft Model 微调 (EAGLE-3)

利用预训练的 MTP (Multi-Token Prediction) 层作为 draft model:

1
2
3
4
5
6
7
8
9
10
11
12
13
┌─────────────────────────────────────────────────────┐
│ EAGLE-3 Draft Model │
├─────────────────────────────────────────────────────┤
│ │
Target Model Features │
│ ├─ 第 1 层 AttnRes ───┐ │
│ ├─ 第 4 层 AttnRes ───┼──► Concat ──► Project
│ └─ 最后一层 AttnRes ──┘ (低/中/高层) (WE3) │
│ 特征 │
│ │
│ WE3 初始化:[0, 0, I] # 与高层特征对齐 │
│ │
└─────────────────────────────────────────────────────┘

训练目标:直接优化接受率

\[\mathcal{L}_{\text{LK}} = -\log \sum_{x \in \mathcal{V}} \min(p(x), q(x))\]

其中 \(p\) 是目标模型分布,\(q\) 是 draft 模型分布。


RL 任务合成与 Agentic 环境

Kimi K3 设计了多种 specialized 环境来支持可扩展的 RL 训练:

1. 统一白盒 RL 环境

将 Agent harness 抽象为可配置、可组合的模块: - 工具接口 - 系统提示词 - 上下文管理策略 - 技能、记忆、子智能体

动态组合:训练时为不同任务组构建不同的 harness 配置,避免对单一 harness 的 overfit。

2. 知识图谱引导的任务合成

1
2
3
4
5
6
7
8
9
10
11
12
13
┌────────────────────────────────────────────────────────┐
│ Knowledge-Graph-Guided Task Synthesis │
├────────────────────────────────────────────────────────┤
│ │
│ 种子节点 ──► Agent 探索 ──► 网页搜索 ──► 发现新概念 │
│ │ │ │
│ │ ▼ │
│ └─────────────────────► 知识图谱节点 │
│ (DAG 结构,粗粒度 → 细粒度) │
│ │
│ 采样节点 ──► 关键词组合 ──► 网页检索 ──► 任务合成 │
│ │
└────────────────────────────────────────────────────────┘

3. 可验证的 Agentic 环境

环境类型 任务示例 验证方式
多步复杂搜索 规划研究、分步收集证据 答案可验证
专业工作流 投行、数据分析、法律实践 交付物评估
视觉推理 STEM 问题、图表理解 Python 执行 + 图像变换
内核优化 CUDA/Triton/TileLang 内核 正确性 + 性能
个人助理 Gmail/Notion/Slack 操作 确定性规则 + LLM 评判

4. 自主执行任务 (AET)

Verify-in-the-loop optimization 范式:

  • 无参考轨迹:Agent 只能看到目标、上下文、约束、验证接口
  • 自主分解:任务分解、工具选择、规划、错误恢复、终止判断
  • 状态验证:奖励基于最终环境状态的验证,而非自报告完成

防 hacking 设计: - Agent 与验证器隔离 - 公开验证器(提供诊断反馈)+ 隐藏验证器(评估保留场景) - 有限提交预算下的惩罚奖励


关键洞见与启发

1. 规模化 RL 的范式转移

Kimi K3 不追求单任务 RL 的 SOTA,而是追求跨领域的规模化

“Scale RL across three broad domains… and train a single expert for each domain at every reasoning effort level”

这种设计使得模型获得组合泛化能力——面对新任务时,能够组合已学到的多种能力。

2. 推理努力级别的工程实践

通过显式的 token 预算控制实现可调推理: - 不是简单的”思考/不思考”切换 - 而是渐进式的 low / high / max 三档 - 通过课程学习(先 max 后 low)逐步压缩

3. 基础设施与算法的协同设计

Partial rollout、沙箱状态持久化、量化感知训练——这些不是孤立的工程优化,而是与算法设计深度耦合:

“This dense reward signal seamlessly integrates into our RL framework, naturally enabling infrastructure-level optimizations”

4. 从 9 个专家到 1 个统一模型

MOPD 的设计体现了一个重要取舍: - 训练时:分别训练 9 个专家(专业化) - 部署时:1 个统一模型(便利性 + 能力迁移) - 通过蒸馏实现从专家到通才的知识传递


与相关工作的对比

维度 Kimi K3 DeepSeek-R1 OpenAI o1
RL 范围 3 领域 × 3 级别 数学 + 代码为主 未公开
推理控制 显式 token 预算 隐式 隐式
专家整合 MOPD 蒸馏 单一模型 未公开
Agentic RL 百万 token 长程 相对短程 未公开
量化训练 MXFP4 QAT BF16 未公开

总结

Kimi K3 的后训练设计体现了系统性思维

  1. 三阶段流水线(SFT → RL → MOPD)各司其职,形成完整的 capability building → specializing → consolidating 闭环

  2. 跨领域规模化 RL打破单任务优化的局限,实现组合泛化

  3. 推理努力级别控制通过工程化的 token 预算机制,让模型的”思考深度”可调可控

  4. 部署感知设计从训练第一天就考虑量化、draft model 等部署需求

  5. 丰富的 Agentic 环境覆盖从内核优化到个人助理的广泛场景,支撑长程 RL 训练

对于正在构建 Agentic 系统的工程师和研究者,Kimi K3 的技术报告提供了从算法到基础设施的完整参考范式。


参考资料


论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
https://kissshhot.github.io/2026/08/17/kimi-k3-post-training/
作者
丁一帆
发布于
2026年8月17日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。