论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力

原论文:GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
作者:Z.ai(智谱AI团队)
发布时间:2026 年 8 月

核心亮点

GLM-5.3 是智谱AI发布的最新开源权重模型,它带来的一个核心启示是:纯后训练(post-training)scaling 足以产生质的突破。GLM-5.3 与 GLM-5.2 共享相同的基础模型,所有性能提升完全来自更大规模的后训练——包括更多环境、更多样化任务和更多强化学习计算。

关键成果: - 开源代码能力新SOTA:Terminal Bench 3.0 从 4.6% 跃升至 28.3%,提升超过 6 倍 - 涌现网络安全能力:CyberGym 84.5%(当前最佳),漏洞利用能力翻倍以上 - 真实漏洞发现:在 269 个项目中发现 2,436 个漏洞,包括 1,097 个中高危漏洞 - 权重即将开源:安全评估和加固完成后两周内发布


方法概述:纯后训练 Scaling

技术栈基础

GLM-5.3 的后训练建立在 GLM-5.2 开发的技术栈之上:

组件 作用 论文/链接
IndexShare 高效长上下文处理 arXiv:2603.12201
SAO 长程任务强化学习 arXiv:2607.07508
slime 大规模异步训练框架 GitHub

环境合成流水线

后训练 scaling 的核心瓶颈从模型转移到了环境。GLM-5.3 建立了端到端的环境合成流水线:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
┌─────────────────────────────────────────────────────────────────┐
│ 环境合成流水线 │
├─────────────────────────────────────────────────────────────────┤
1. 研究智能体 (Research Agents) │
│ └─ 从真实工作中收集任务模式,生成长程环境(多步依赖+隐藏状态)│
├─────────────────────────────────────────────────────────────────┤
2. 评判智能体 (Judge Agent) │
│ └─ 尝试每个任务,验证其可解性 │
├─────────────────────────────────────────────────────────────────┤
3. 验证器合成 (Verifier Synthesis) │
│ ├─ 无参考解决方案合成验证器 │
│ ├─ 使用求解轨迹发现并关闭奖励捷径 │
│ └─ 通过 oracle/no-op/未解决状态检查 → 可靠二元奖励 │
└─────────────────────────────────────────────────────────────────┘

SAO + Compaction 持续应用

GLM-5.3 延续了 GLM-5.2 的 SAO(Step-level Advantage Optimization) 策略: - 带 compacting 的 RL 策略确保在长程任务上保持收益 - 避免仅适用于短任务的性能提升


性能表现

编程能力:开源模型新标杆

基准测试 GLM-5.3 GLM-5.2 提升幅度 其他参考
Terminal Bench 3.0 28.3 4.6 +515% Opus 4.8: 21.1
Terminal Bench 2.1 88.2 81.0 +8.9% Kimi K3: 88.3
DeepSWE v1.1 66.9 46.2 +44.8% Kimi K3: 67.5
SWE-Marathon v1.1 42.5 19.4 +119% Opus 4.8: 48.8
Agents’ Last Exam 28.5 23.8 +19.7% GPT-5.6 Sol: 28.6
ProgramBench 19.0 9.5 +100% Fable 5: 33.0

Terminal Bench 3.0 的 6 倍提升尤其引人注目,这表明 GLM-5.3 在处理复杂终端任务方面取得了质的飞跃。

网络安全:意外涌现的能力

最令人惊讶的发现:随着后训练规模扩大,网络安全能力的发展速度远超预期。

基准测试 GLM-5.3 GLM-5.2 提升 说明
CyberGym 84.5% 77.2% +9.5% 当前最佳,超越 Mythos 5 (83.8%) 和 GPT-5.6 Sol (83.6%)
ExploitBench 54.4% 24.4% +123% 漏洞利用能力翻倍以上
ExploitGym (2h/6h) 105/130 29/39 +262%/+233% 时间归一化预算下的任务完成数

关键洞察:越接近完整利用链顶端的基准测试,GLM-5.3 相对于 GLM-5.2 的提升越大——但同时与闭源前沿模型的差距也越大。能力增长最快的领域正是当前差距最大的领域。

从孤立缺陷识别到完整利用链规划

GLM-5.3 不仅仅是更好地识别孤立漏洞,而是开始: - 跨多个利用阶段进行推理 - 形成完整利用链的连贯计划 - 在复杂场景下执行端到端攻击

智能体能力

基准测试 GLM-5.3 GLM-5.2 提升
Toolathlon Verified 73.0% 59.9% +21.9%
AutomationBench v1.0.6 48.2% 26.2% +83.9%
HLE w/ Tools 62.5% 54.7% +14.3%

Z.ai Code Bench:真实场景评估

为了更准确地评估真实用户体验,Z.ai 引入了内部基准测试 Z.ai Code Bench

  • 评估维度:端到端任务完成率 + 细粒度检查清单准确率
  • 环境设置:复杂的本地开发环境
  • 优势:作为私有基准,减少公共测试集污染风险

性能与效率双提升

GLM-5.3 在每个 effort 级别上都实现了更高的性能和更低的 token 消耗

Effort 级别 GLM-5.3 性能 GLM-5.3 Tokens GLM-5.2 性能 GLM-5.2 Tokens
Max 34.5% ~75K 23.4% ~96K
High 31.4% ~50K - -

对比闭源模型: - GLM-5.3 High (31.4%, ~50K tokens) > Claude Opus 4.8 (29.5%, 120K tokens) - 但仍落后于 Claude Fable 5 (39.5% at Max effort)


真实漏洞发现成果

GLM-5.3 的能力不仅体现在基准测试上,更在真实世界中得到验证:

发现统计

  • 总漏洞数:2,436 个
  • 涉及项目:269 个
  • 中高危漏洞:1,097 个
  • 覆盖领域:系统内核、操作系统、浏览器引擎、开源基础设施、Web应用、网络协议
  • 最古老漏洞:约 40 年前引入(1981年)
  • 平均潜伏时间:26.6 年

Z.ai 安全披露账本

智谱AI建立了 Z.ai Security Disclosure Ledger 来跟踪这些漏洞的披露过程: - 持续更新漏洞审查和披露状态 - 区分已公开和仍在披露流程中的问题 - 记录受影响项目、严重程度、CVE编号和潜伏时间


slime:长程 RL 扩展框架

GLM-5.3 的所有训练都运行在 slime 开源后训练框架上:

架构设计

1
2
3
4
5
6
7
8
9
10
┌─────────────────────────────────────────────────────────────────┐
│ slime 架构 │
├─────────────────────────────────────────────────────────────────┤
│ 训练端:Megatron │
│ 推理端:SGLang │
│ 数据流:训练 + 推理 + 数据缓冲区 一体化 │
├─────────────────────────────────────────────────────────────────┤
│ 插件式设计:数学、代码、沙盒、验证器、长程智能体环境 │
│ └─ 作为数据生成插件,而非训练循环修改 │
└─────────────────────────────────────────────────────────────────┘

GLM-5.3 新增能力

算法侧: | 功能 | 说明 | |——|——| | top-p mask | 更精细的采样控制 | | top-k / 全词表 OPD | 灵活的在线策略蒸馏 | | R3-style 配置 | 改善训练-推理一致性 | | 完整数值对齐 | 训练和推理路径的数值完全对齐 |

训练-推理一致性:logprob 平均差异控制在 1e-7 级别,相比之前降低 99.99% 以上。

系统侧

优化 效果
分层本地存储缓存 模型状态和数据层次化存储,减少主机内存占用
多教师 OPD 动态切换 无需为每个教师单独启动推理服务
路由器和 slime 联合调度 处理长度差异大的 rollout 请求
负载感知启发式 根据环境特征推导吞吐量优化配置

性能提升:长程代码 RL 任务端到端训练吞吐量提升 2.3 倍以上


API 变更与使用指南

思考模式调整

GLM-5.3 不再支持禁用思考,始终启用 thinking,但提供三个 effort 级别:

参数 可选值 默认值 说明
thinking.type enabled enabled 必须设置为 enabled
reasoning_effort low / high / max max 代码任务推荐 max

迁移注意:如果当前使用 thinking.type: "disabled",需要先改为 enabled 并设置 reasoning_effort: "low",再更新模型 ID。

与编程工具集成

GLM-5.3 已集成到主流编程智能体: - ZCode(智谱官方) - Claude Code - OpenCode

GLM Coding Plan 订阅者权益: - 98%+ 缓存命中率,~30% 有效 token 提升 - 限时 1.5x 配额加成(可与缓存叠加,最高 180%) - Goal 模式:规划、编码、测试、验证直至目标完成 - Remote Control:通过微信/飞书远程监控长程任务


关键洞察与启示

1. 后训练 Scaling 的幂律

GLM-5.3 证明:在成熟的基础模型上,持续扩大后训练规模可以产生显著的能力跃迁。这与近期其他研究(如 Kimi K3)形成呼应,表明后训练正在成为大模型能力提升的主战场。

2. 环境是新的瓶颈

“As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment.”

有用的任务环境必须满足: - 可执行(executable) - 可验证(verifiable) - 接近真实专业工作(close to real professional work)

且需要大量这样的环境,而非少数手工构建的示例。

3. 网络安全能力的涌现特性

网络安全能力的发展呈现出非线性增长特征: - 初期:更好的漏洞识别 - 临界点:开始形成完整利用链的推理能力 - 后期:在真实场景中系统性发现漏洞

这种模式提示我们:某些能力可能只在特定训练规模后才显现

4. 评估基准的局限性

智谱团队指出公共编码基准测试的问题: - 易受污染(contamination-prone) - 无法很好反映用户对编程智能体的实际需求

因此他们建立了私有基准 Z.ai Code Bench,这提示研究者和从业者:真实场景评估可能比公开排行榜更重要


总结

GLM-5.3 代表了开源大模型在后训练 scaling 方面的重要里程碑。它的核心贡献在于:

  1. 实证了纯后训练 scaling 的潜力:相同基础模型,仅通过后训练扩展即可实现 6 倍以上的特定任务提升
  2. 揭示了网络安全能力的涌现路径:从孤立漏洞识别到完整利用链规划的质变
  3. 建立了真实漏洞发现的实际应用:2,436 个漏洞的发现证明了模型在实际安全领域的价值
  4. 开源了完整的技术栈:slime 框架为社区提供了长程 RL 扩展的基础设施

对于研究者和从业者,GLM-5.3 的发布意味着: - 开源模型在代码和网络安全领域正快速追赶闭源前沿 - 后训练和环境工程正在成为大模型开发的核心竞争力 - 智能体能力的评估需要更多真实场景、更少基准刷分


权重将在安全评估完成后两周内开源,届时社区可以进一步探索这一模型的能力边界。


论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
https://kissshhot.github.io/2026/08/18/glm-5.3-frontier-coding-cyber/
作者
丁一帆
发布于
2026年8月18日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。