主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么

过去两年,开源基座模型经历了一轮疯狂的迭代:2024 年底 DeepSeek-V3 用 557 万美元的训练成本震惊业界,2025 年 R1 带火了 RL 推理范式,Qwen3 / Kimi K2 / GLM-4.5 / GPT-OSS 密集发布;进入 2026 年,Kimi K3、DeepSeek-V4、MiniMax M3 又把总参数量推到万亿级、上下文推到百万 token。

这篇文章把有正式技术报告(或官方模型卡)可查的主流基座模型做一次横向梳理,分”2025 奠基代”和”2026 前沿代”两代,从架构、预训练配方、后训练方法、开放程度四个维度对比,最后总结两代之间的技术演进趋势。

总览:一张表看清格局

模型 发布方 时间 总参/激活 上下文 预训练数据 License
DeepSeek-V3 DeepSeek 2024-12 671B / 37B 128K 14.8T 代码 MIT + 模型许可
DeepSeek-R1 DeepSeek 2025-01 671B / 37B 128K (基于 V3-Base) MIT
Gemma 3 Google 2025-03 1B~27B dense 32K~128K 2T~14T Gemma 许可
Llama 4 Scout/Maverick Meta 2025-04 109B/17B、400B/17B 10M / 1M ~40T / ~22T Llama 社区许可(有限制)
Qwen3 阿里通义 2025-05 0.6B~235B(旗舰 235B/22B) 32K~128K 36T Apache 2.0
MiniMax-M1 MiniMax 2025-06 456B / 45.9B 1M 7.5T(持续预训练) Apache 2.0
Kimi K2 月之暗面 2025-07 1.04T / 32.6B 128K 15.5T 开放权重
GLM-4.5 智谱 Z.ai 2025-08 355B/32B、Air 106B/12B 128K 23T 开放权重
GPT-OSS-120b/20b OpenAI 2025-08 117B/5.1B、21B/3.6B 131K 未披露(数万亿) Apache 2.0
Seed-OSS-36B 字节 Seed 2025-08 36B dense 512K 12T Apache 2.0
DeepSeek-V4 Pro/Flash DeepSeek 2026-04 1.6T/49B、284B/13B 1M 33T / 32T MIT
MiniMax M3 MiniMax 2026-06 428B / 23B 1M 未披露 MiniMax 社区许可
Kimi K3 月之暗面 2026-07 2.78T / 104B 1M 未披露 开放权重
Qwen3.8-Flash-Next 阿里通义 2026-08 125B / 6B 262K(可扩 1M) 未披露 Qwen 社区许可

几个一眼可见的趋势:总参数量全面进入万亿时代(K3 2.78T、V4-Pro 1.6T),激活参数却在收敛(6B~104B,靠 MoE 稀疏度换推理成本),1M 上下文成为 2026 代标配


2025 奠基代:确立范式的一年

DeepSeek-V3:成本革命与 MLA

报告:DeepSeek-V3 Technical Report(arXiv:2412.19437,2024-12)

DeepSeek-V3 是这轮开源浪潮的起点,核心是把”大模型必须烧钱”的认知打破:

  • 架构:671B 总参 / 37B 激活,61 层;MLA(Multi-head Latent Attention)把 KV cache 压到 512 维隐向量;DeepSeekMoE 用 1 共享专家 + 256 路由专家、每 token 激活 8 个
  • 首创无辅助损失的负载均衡(auxiliary-loss-free,仅用 bias 项调路由),训练/推理全程无 token 丢弃
  • 预训练 14.8T tokens,总成本 278.8 万 H800 GPU 小时 ≈ 557 万美元——这个数字让”前沿模型训练要几亿美元”的叙事破产
  • Infra 三板斧:FP8 混合精度训练(相对损失误差 <0.25%)、DualPipe 双向流水线重叠通信、MTP 多 token 预测(推理时还能当投机解码用)

DeepSeek-R1:纯 RL 的”aha moment”

报告:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv:2501.12948,2025-01;后发表于 Nature)

R1 证明了推理能力可以纯靠 RL 涌现,不依赖人工标注的思维链:

  • R1-Zero:直接在 V3-Base 上跑 GRPO(组相对策略优化,无 critic),只用规则奖励(答案对不对 + 格式对不对),刻意不用神经奖励模型防 reward hacking。AIME 2024 pass@1 从 15.6% 一路涨到 77.9%,训练中自发涌现”wait,让我重新想想”式的自我反思
  • R1 完整 pipeline:冷启动 SFT(几千条筛选过的长 CoT)→ 推理 RL → 拒绝采样生成 80 万样本再 SFT → 全场景 RL
  • 蒸馏生态:用 R1 生成的数据 SFT 出 6 个小模型(基于 Qwen2.5/Llama),R1-Distill-Qwen-32B 的 AIME 达 72.6,至今仍是蒸馏baseline的标配
  • MIT 协议全开放,这是它成为事实标准的关键

Qwen3:最全家桶与混合思考模式

报告:Qwen3 Technical Report(arXiv:2505.09388,2025-05)

Qwen3 的策略是尺寸全覆盖 + 单模型双模式

  • 一口气发 8 个模型:6 个 dense(0.6B~32B)+ 2 个 MoE(30B-A3B、235B-A22B),全部 Apache 2.0
  • 36T tokens 预训练、119 种语言;三阶段预训练(通用 → 推理强化 → 长上下文)
  • 后训练四阶段:Long-CoT 冷启动 → 推理 RL(GRPO)→ Thinking 模式融合(一个模型里 /think 和 /no_think 两种模式,支持 thinking budget 控制)→ 通用 RL
  • 一个值得注意的数据:对小模型做 on-policy 蒸馏只要 1,800 GPU 小时,效果反超跑 17,920 小时的 RL(AIME 74.4 vs 67.6)——蒸馏性价比之高,直接影响了后来 Kimi K3 的 MOPD 设计

Kimi K2:MuonClip 与 Agentic 数据工厂

报告:Kimi K2: Open Agentic Intelligence(arXiv:2507.20534,2025-07)

K2 是首个万亿参数级开源模型(1.04T 总参 / 32.6B 激活),两个核心贡献:

  • MuonClip 优化器:在 Muon(Newton-Schulz 正交化动量)基础上加 QK-Clip——当注意力 logit 超过阈值就按比例缩放 Q/K 投影权重。结果:15.5T tokens 训练全程零 loss spike。Muon 从此成为大模型训练的主流优化器选项
  • Agentic 数据合成流水线:3,000+ 真实 MCP 工具 + 20,000+ 合成工具 → 数千个 agent 配置 → 模拟用户 + 有状态工具模拟器生成轨迹 → rubric 过滤。这套”数据工厂”打法定义了 agentic 训练的标准流程
  • SWE-bench Verified 65.8、LiveCodeBench 53.7,发布时开源第一;LMSYS Arena 开源第一、总榜第五

GLM-4.5:Agentic / Reasoning / Coding 三合一

报告:GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models(arXiv:2508.06471,2025-08)

  • 355B 总参 / 32B 激活(Air 版 106B/12B),23T tokens,128K 上下文
  • 明确定位 ARC 三位一体,后训练拆成推理 RL(两阶段难度课程)、代码 RL(token 加权 loss)、Agentic RL(结果监督 + 过程格式惩罚 + 迭代自蒸馏)多条线
  • 开源了 RL 框架 Slime(BF16 训练 + FP8 rollout)
  • 论文自评 12 项 benchmark 综合第 3、agentic 第 2。AIME’24 91.0、SWE-bench Verified 64.2

MiniMax-M1:线性注意力上的大规模 RL

报告:MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention(arXiv:2506.13585,2025-06)

  • 456B 总参 / 45.9B 激活,每 7 层 lightning attention(线性注意力)夹 1 层 softmax attention,原生支持 1M 上下文、80K 输出;生成 100K token 的 FLOPs 只有 DeepSeek-R1 的 25%
  • CISPO 算法:clip 重要性采样权重而不是 token 更新量,保住了 “However/Recheck/Wait/Aha” 这类稀有反思 token 的梯度;在 AIME 上比 DAPO 收敛快 2 倍
  • RL 全程成本透明:512 张 H800 跑 3 周,租金约 $534,700

GPT-OSS:OpenAI 时隔六年的开放权重

模型卡:gpt-oss-120b & gpt-oss-20b Model Card(arXiv:2508.10925,2025-08)

  • 117B/5.1B 与 21B/3.6B 两个 MoE,交替使用带状滑窗(128 tokens)与全稠密注意力;MoE 权重压到 MXFP4(约 4.25 bit/参数),120b 单张 80GB 卡可跑、20b 能塞进 16GB 内存
  • 后训练是与 o3 同源的 CoT RL;配套开放 Harmony 对话格式(System > Developer > User > Assistant > Tool 的指令层级)
  • Apache 2.0,连 tokenizer(o200k_harmony)和工具环境一起开放
  • 训练成本:120b 用了 210 万 H100 小时

Gemma 3 与 Seed-OSS-36B:dense 阵营的坚守

  • Gemma 3(arXiv:2503.19786,2025-03):Google 的 dense 系列(1B/4B/12B/27B),5:1 local/global 交替注意力(local 滑窗 1024),预训练大量使用从大模型蒸馏(每 token 采 256 个 logits 加权交叉熵),27B 用 14T tokens
  • Seed-OSS-36B(字节 Seed,2025-08,GitHub 发布):36B dense,原生 512K 上下文,12T tokens;贴心地发了含合成数据与不含合成数据两个 base 版本方便后训练研究;Instruct 版支持 thinking budget 控制,AIME’24 91.7。Apache 2.0

2026 前沿代:万亿参数、百万上下文、原生多模态

DeepSeek-V4:把 1M 上下文的成本打下来

报告:DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence(arXiv:2606.19348,2026-04,预览版)

  • 双版本:V4-Pro 1.6T/49B、V4-Flash 284B/13B,均支持 1M tokens
  • 混合压缩注意力 CSA + HCA:CSA 每 m 个 token 压缩成 1 条 KV 再稀疏选择,HCA 用更高压缩率做稠密注意力;配合共享 KV 的 MQA 与 partial RoPE(仅最后 64 维加位置编码)
  • mHC(流形约束超连接):用 Sinkhorn-Knopp 把残差约束到双随机流形上,替代标准残差连接
  • 优化器从 AdamW 转向 Muon;MoE 专家用 FP4 量化感知训练
  • 效率对比触目惊心:1M 上下文下,V4-Pro 的单 token 推理 FLOPs 只有 V3.2 的 27%,KV cache 只有 10%(Flash 更是 10% / 7%)
  • Benchmark(Max 模式):V4-Pro 的 SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces rating 3206,官方自评推理能力距 GPT-5.4/Gemini-3.1-Pro 约 3~6 个月差距。MIT 协议

Kimi K3:2.78T 的开放前沿

报告:Kimi K3: Open Frontier Intelligence(arXiv:2607.24653,2026-07)

目前参数量最大的开源模型,也是这份名单里技术密度最高的报告之一:

  • 2.78T 总参 / 104B 激活,93 层,896 个路由专家激活 16 个;混合注意力 = 69 层 KDA(Kimi Delta Attention,线性注意力)+ 24 层带门控的 MLA(NoPE,无位置编码,天然支持 1M 外推)
  • Attention Residuals:把 93 层切成 8 个 block,每层可以”注意”到 embedding 和前序 block 的输出,替代逐层残差,开销从 O(Ld) 降到 O(Nd)
  • 原生多模态:MoonViT-V2 视觉编码器从零与语言模型联合训练,没有后置对齐阶段
  • 优化器 Per-Head Muon(逐注意力头正交化)+ K2 的 weight clipping
  • 后训练三连:SFT → 三领域 × 三推理 effort 的 RL(共九个专家模型)→ MOPD(多教师 On-Policy 蒸馏)合并——正是我们之前写过的 Open-MOPD 要诊断修复的那个训练范式
  • Agentic 环境做到极致:统一白盒 RL 环境实例化各家 coding harness、内核优化任务(CUDA/Triton/TileLang)、模拟 Gmail/Notion/Slack 的个人助理任务(“数千次工具调用、百万级上下文”)
  • Benchmark 亮点:BrowseComp 91.2、SWE-Marathon 42.0、ProgramBench 77.8,多项超过同期闭源前沿;单卡 batch-1 解码约 113 tok/s(SGLang)

MiniMax M3:从预训练第一步就是多模态

模型卡 + MiniMax Sparse Attention(arXiv:2606.13392,2026-06)

  • 428B 总参 / 23B 激活,1M 上下文;首个从预训练第一步就做文本/图像/视频交错混合训练的开源模型
  • MSA 稀疏注意力:轻量 index 分支对每个 GQA group 打分选 Top-k KV block,主分支只对选中 block 做精确注意力;1M 上下文下 per-token 注意力计算降 28.4 倍,prefill 加速 9 倍、decode 加速 15 倍
  • SWE-bench Verified 80.5、MMMU Pro 78.1、Video-MME v2 85.4

Qwen3.8-Flash-Next:Qwen4 架构的早期预览

模型卡(HuggingFace,2026-08-26 发布)

  • 125B 总参 / 仅 6B 激活(激活率不到 5%),多模态 MoE,原生 262K 上下文、YaRN 可扩至 1M
  • 架构布局 12 × (3×(GDN→MoE) → 1×(QSA→MoE))GDN(Gated DeltaNet 线性注意力)为主、QSA(Qwen 稀疏注意力)为辅;外加 51B 的 n-gram embedding 表和 4B MTP 层
  • 训练 recipe:Muon 与 AdamW 分权重类别混用、无 batch-size warmup(直接以目标 batch size 开训)
  • GPQA Diamond 91.7、LiveCodeBench v6 91.9、SWE-bench Multilingual 81.0;训练成本约为上一代 Plus 模型的 1/9

Llama 4:Meta 的 MoE 转身

官方模型卡(2025-04;注:arXiv:2601.11659 那篇第三方汇编已被撤稿,以下以 Meta 官方模型卡为准)

  • Scout:109B/17B、16 专家、10M 上下文;Maverick:400B/17B、128 专家、1M 上下文;early fusion 原生多模态
  • 预训练 200 种语言,Scout 用了约 40T tokens;合计 738 万 H100 小时
  • Llama 4 社区许可限制最多:月活超 7 亿的公司需单独申请、衍生模型必须以 “Llama” 命名开头——这也是 2025 年后社区重心明显转向 DeepSeek/Qwen/Kimi 系的原因之一

两代对比:基模技术的五个演进方向

把两代报告放在一起看,有几条清晰的演进主线:

1. 注意力机制:从”压缩 KV”走向”线性化 + 稀疏化混合”。 2025 代的主流是 MLA(DeepSeek-V3/K2)和 GQA(其余各家);2026 代全面转向混合架构——K3 的 KDA+MLA、V4 的 CSA+HCA、Qwen3.8 的 GDN+QSA、M3 的 MSA,目标一致:让 1M 上下文的注意力成本下降一个数量级,同时保留少量全注意力层保住质量。纯 softmax 全注意力在大模型上已经退场。

2. 优化器:Muon 取代 AdamW 成为大模型预训练默认。 K2 的 MuonClip 证明了 Muon 在万亿规模零 loss spike;2026 代 V4、K3(Per-Head Muon)、Qwen3.8 全部跟进,QK-Clip 这类注意力 logit 稳定化技术成为标配。

3. 后训练:从”对齐”变成”主战场”。 R1 的 GRPO 打开局面后,各家卷出了 CISPO(M1,clip IS 权重保稀有 token)、多专家 RL + 蒸馏合并(K3 的 MOPD、Qwen3-Coder-Next 的四专家蒸馏)、agentic 环境规模化(K2/K3 的工具模拟器与白盒 harness)。RL 算力占比在 2026 代已可比肩预训练的一部分,且 agentic RL 成为差异化的核心。

4. 精度与 infra:FP8 → FP4。 V3 的 FP8 训练在 2025 年是独一份;到 V4/M3/GPT-OSS,MXFP4 量化感知训练 + 混合精度 KV cache 已成常态,推理成本被进一步腰斩。

5. 开放度分化。 最开放一档:DeepSeek(MIT)、Qwen3/GPT-OSS/Seed-OSS/MiniMax-M1(Apache 2.0);中间档:MiniMax M3 / Qwen3.8(各自社区许可)、Kimi(开放权重);最保守:Llama 4(MAU 门槛 + 命名限制)。中文实验室在开放程度上整体反超了美国同行。

参考链接

2025 奠基代 - DeepSeek-V3:https://arxiv.org/abs/2412.19437 - DeepSeek-R1:https://arxiv.org/abs/2501.12948 - Qwen3:https://arxiv.org/abs/2505.09388 - Kimi K2:https://arxiv.org/abs/2507.20534 - GLM-4.5:https://arxiv.org/abs/2508.06471 - MiniMax-M1:https://arxiv.org/abs/2506.13585 - GPT-OSS:https://arxiv.org/abs/2508.10925 - Gemma 3:https://arxiv.org/abs/2503.19786 - Seed-OSS-36B:https://github.com/ByteDance-Seed/Seed-OSS

2026 前沿代 - DeepSeek-V4:https://arxiv.org/abs/2606.19348 - Kimi K3:https://arxiv.org/abs/2607.24653 - MiniMax MSA:https://arxiv.org/abs/2606.13392 - MiniMax M3:https://huggingface.co/MiniMaxAI/MiniMax-M3 - Qwen3.8-Flash-Next:https://huggingface.co/Qwen/Qwen3.8-Flash-Next - Llama 4:https://huggingface.co/meta-llama

小结

如果说 2025 年代回答的问题是”开源能不能追平闭源”(答案:能),2026 年代回答的问题就是”开源能不能定义前沿”——K3 在 BrowseComp/SWE-Marathon 上反超同期闭源模型,说明至少在一部分维度上答案是肯定的。对从业者来说,这两代报告合起来就是一份完整的现代基模训练手册:架构选混合注意力 MoE、优化器上 Muon、后训练把 RL 当主战场、infra 压到 FP4,剩下的就是数据和工程了。


主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么
https://kissshhot.github.io/2026/08/27/foundation-model-tech-reports-survey/
作者
丁一帆
发布于
2026年8月27日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。