论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
原论文:Kimi K3: Open Frontier Intelligence
作者:Kimi Team
发布时间:2026 年 7 月
引言
Kimi K3 是 Moonshot AI 发布的 2.8T 参数 MoE 大模型,拥有 1040 亿激活参数、原生视觉能力和 100 万 token 上下文窗口。在这篇技术报告中,后训练(Post-Training)阶段的设计尤其值得关注——它采用了三阶段范式,通过跨通用、Agentic、编程三大领域的强化学习,结合多推理努力级别的训练策略,实现了组合泛化与鲁棒的长程执行能力。
本文将详细拆解 Kimi K3 的后训练流程。
后训练三阶段范式概览
Kimi K3 的后训练遵循以下三阶段架构:
1 | |
Stage 1: 监督微调 (SFT)
核心目标
SFT 阶段的核心任务是建立一个高质量的冷启动策略,为后续的 RL 训练奠定基础。
关键设计
| 设计点 | 说明 |
|---|---|
| 数据合成 | 使用 Kimi 系列领域专用模型合成数据轨迹 |
| 验证流程 | 多阶段验证 + 人工在环标注 |
| 序列化格式 | XTML (eXtensible Token Markup Language) 统一表示复杂 Agentic 轨迹 |
| 量化感知训练 | 从 SFT 阶段开始使用 MXFP4 权重 + MXFP8 激活 |
XTML 的作用
XTML 是 Kimi K3 设计的基于 token 的聊天模板,用于一致地表示复杂的 Agentic 交互轨迹。这种格式化的优势在于:
- 支持自适应推理的显式表达
- 统一工具调用的序列化方式
- 保留长程执行的完整上下文
Stage 2: 强化学习 (RL)
这是 Kimi K3 后训练的核心创新所在。与为单个任务训练专用 RL 模型的传统做法不同,Kimi K3 采用跨领域规模化 RL策略。
三大训练领域
1 | |
Partial Rollout:解决长程任务延迟问题
对于长程 Agentic 任务,轨迹完成时间差异巨大(长尾延迟)。Kimi K3 采用 Partial Rollout 方案:
1 | |
关键设计: - 单条长程轨迹可以跨多个迭代完成 - 引入数据陈旧性(off-policy)但通过 per-token regularization 保持稳定性 - 沙箱基础设施支持轨迹状态的持久化与恢复
推理努力级别控制 (Reasoning Effort RL)
这是 Kimi K3 的重要创新——通过 token 预算控制实现可调的推理努力级别。
预算控制机制:
对于每个问题 \(x\): - 设定初始 token 预算 \(b_0(x)\)(从冷启动模型估计) - 设定预算乘数阈值 \(\tau\) - 如果轨迹总 token 数 \(T(y) > \tau \cdot b_0(x)\),奖励设为 -1(惩罚)
训练课程:
| 阶段 | 预算乘数 τ | 目标 |
|---|---|---|
| 第一阶段 | 较大值 | 训练 max-budget 专家(高推理能力) |
| 第二阶段 | 中等值 | 退火得到 high 努力级别 |
| 第三阶段 | 较小值 | 得到 low 努力级别 |
不同任务的 token 计量方式: - 通用任务:只计算 thinking tokens - Agentic 任务:计算累计输出 tokens(推理 + 工具调用参数)
Agentic 生成式奖励模型 (Agentic GRM)
对于非可验证的通用任务,Kimi K3 使用 Agentic GRM 进行评判:
评判协议(必须遵循的 4 步流程): 1. 读取输出/产物/文本 2. 生成评分标准 (rubric) 3. 对照标准给每个候选打分 4. 记录分数到评分表
防 Reward Hacking: - 设定输出长度预算 \(\ell_0\) 和乘数 \(\sigma\) - 输出长度超过 \(\sigma \cdot \ell_0\) 的候选自动判负
Stage 3: 多教师在线策略蒸馏 (MOPD)
核心目标
将 9 个领域专家(3 领域 × 3 推理级别)的能力整合到单一模型中。
OPD 奖励函数
对于领域 \(d\) 和推理努力级别 \(e\),OPD 奖励定义为:
\[r^{d}_{\text{opd}}(y_t \mid e, x, y_{<t}) = \text{clip}\left(\text{sg}\left(\log \frac{\pi_{\text{teacher}}^{(d,e)}(y_t \mid x, y_{<t})}{\pi_{\theta}(y_t \mid e, x, y_{<t})}\right), -R_{\max}, R_{\max}\right)\]
其中: - \(\text{sg}(\cdot)\) 是 stop-gradient 算子 - \(R_{\max}\) 是裁剪阈值,防止极端优势信号
MOPD 的优势
- 密集奖励信号:每个 token 都有梯度信号
- 基础设施兼容:天然支持 partial rollout
- 灵活的专家选择:训练时可采样不同的 (domain, effort) 组合
部署感知后训练 (Deployment-Aware Post-Training)
MXFP4 量化感知训练
| 组件 | 精度 |
|---|---|
| MoE Expert 权重 | MXFP4 |
| Expert 输入激活 | MXFP8 |
| 非 Expert 组件 (Attention, Router 等) | 高精度 |
关键设计: - 整个后训练阶段(SFT + RL)都使用 QAT - Rollout 和训练共享相同的量化方案 - 消除训练-推理不匹配
Draft Model 微调 (EAGLE-3)
利用预训练的 MTP (Multi-Token Prediction) 层作为 draft model:
1 | |
训练目标:直接优化接受率
\[\mathcal{L}_{\text{LK}} = -\log \sum_{x \in \mathcal{V}} \min(p(x), q(x))\]
其中 \(p\) 是目标模型分布,\(q\) 是 draft 模型分布。
RL 任务合成与 Agentic 环境
Kimi K3 设计了多种 specialized 环境来支持可扩展的 RL 训练:
1. 统一白盒 RL 环境
将 Agent harness 抽象为可配置、可组合的模块: - 工具接口 - 系统提示词 - 上下文管理策略 - 技能、记忆、子智能体
动态组合:训练时为不同任务组构建不同的 harness 配置,避免对单一 harness 的 overfit。
2. 知识图谱引导的任务合成
1 | |
3. 可验证的 Agentic 环境
| 环境类型 | 任务示例 | 验证方式 |
|---|---|---|
| 多步复杂搜索 | 规划研究、分步收集证据 | 答案可验证 |
| 专业工作流 | 投行、数据分析、法律实践 | 交付物评估 |
| 视觉推理 | STEM 问题、图表理解 | Python 执行 + 图像变换 |
| 内核优化 | CUDA/Triton/TileLang 内核 | 正确性 + 性能 |
| 个人助理 | Gmail/Notion/Slack 操作 | 确定性规则 + LLM 评判 |
4. 自主执行任务 (AET)
Verify-in-the-loop optimization 范式:
- 无参考轨迹:Agent 只能看到目标、上下文、约束、验证接口
- 自主分解:任务分解、工具选择、规划、错误恢复、终止判断
- 状态验证:奖励基于最终环境状态的验证,而非自报告完成
防 hacking 设计: - Agent 与验证器隔离 - 公开验证器(提供诊断反馈)+ 隐藏验证器(评估保留场景) - 有限提交预算下的惩罚奖励
关键洞见与启发
1. 规模化 RL 的范式转移
Kimi K3 不追求单任务 RL 的 SOTA,而是追求跨领域的规模化:
“Scale RL across three broad domains… and train a single expert for each domain at every reasoning effort level”
这种设计使得模型获得组合泛化能力——面对新任务时,能够组合已学到的多种能力。
2. 推理努力级别的工程实践
通过显式的 token 预算控制实现可调推理: - 不是简单的”思考/不思考”切换 - 而是渐进式的 low / high / max 三档 - 通过课程学习(先 max 后 low)逐步压缩
3. 基础设施与算法的协同设计
Partial rollout、沙箱状态持久化、量化感知训练——这些不是孤立的工程优化,而是与算法设计深度耦合:
“This dense reward signal seamlessly integrates into our RL framework, naturally enabling infrastructure-level optimizations”
4. 从 9 个专家到 1 个统一模型
MOPD 的设计体现了一个重要取舍: - 训练时:分别训练 9 个专家(专业化) - 部署时:1 个统一模型(便利性 + 能力迁移) - 通过蒸馏实现从专家到通才的知识传递
与相关工作的对比
| 维度 | Kimi K3 | DeepSeek-R1 | OpenAI o1 |
|---|---|---|---|
| RL 范围 | 3 领域 × 3 级别 | 数学 + 代码为主 | 未公开 |
| 推理控制 | 显式 token 预算 | 隐式 | 隐式 |
| 专家整合 | MOPD 蒸馏 | 单一模型 | 未公开 |
| Agentic RL | 百万 token 长程 | 相对短程 | 未公开 |
| 量化训练 | MXFP4 QAT | BF16 | 未公开 |
总结
Kimi K3 的后训练设计体现了系统性思维:
三阶段流水线(SFT → RL → MOPD)各司其职,形成完整的 capability building → specializing → consolidating 闭环
跨领域规模化 RL打破单任务优化的局限,实现组合泛化
推理努力级别控制通过工程化的 token 预算机制,让模型的”思考深度”可调可控
部署感知设计从训练第一天就考虑量化、draft model 等部署需求
丰富的 Agentic 环境覆盖从内核优化到个人助理的广泛场景,支撑长程 RL 训练
对于正在构建 Agentic 系统的工程师和研究者,Kimi K3 的技术报告提供了从算法到基础设施的完整参考范式。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。