论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
原论文:GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
作者:Z.ai(智谱AI团队)
发布时间:2026 年 8 月
核心亮点
GLM-5.3 是智谱AI发布的最新开源权重模型,它带来的一个核心启示是:纯后训练(post-training)scaling 足以产生质的突破。GLM-5.3 与 GLM-5.2 共享相同的基础模型,所有性能提升完全来自更大规模的后训练——包括更多环境、更多样化任务和更多强化学习计算。
关键成果: - 开源代码能力新SOTA:Terminal Bench 3.0 从 4.6% 跃升至 28.3%,提升超过 6 倍 - 涌现网络安全能力:CyberGym 84.5%(当前最佳),漏洞利用能力翻倍以上 - 真实漏洞发现:在 269 个项目中发现 2,436 个漏洞,包括 1,097 个中高危漏洞 - 权重即将开源:安全评估和加固完成后两周内发布
方法概述:纯后训练 Scaling
技术栈基础
GLM-5.3 的后训练建立在 GLM-5.2 开发的技术栈之上:
| 组件 | 作用 | 论文/链接 |
|---|---|---|
| IndexShare | 高效长上下文处理 | arXiv:2603.12201 |
| SAO | 长程任务强化学习 | arXiv:2607.07508 |
| slime | 大规模异步训练框架 | GitHub |
环境合成流水线
后训练 scaling 的核心瓶颈从模型转移到了环境。GLM-5.3 建立了端到端的环境合成流水线:
1 | |
SAO + Compaction 持续应用
GLM-5.3 延续了 GLM-5.2 的 SAO(Step-level Advantage Optimization) 策略: - 带 compacting 的 RL 策略确保在长程任务上保持收益 - 避免仅适用于短任务的性能提升
性能表现
编程能力:开源模型新标杆
| 基准测试 | GLM-5.3 | GLM-5.2 | 提升幅度 | 其他参考 |
|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | +515% | Opus 4.8: 21.1 |
| Terminal Bench 2.1 | 88.2 | 81.0 | +8.9% | Kimi K3: 88.3 |
| DeepSWE v1.1 | 66.9 | 46.2 | +44.8% | Kimi K3: 67.5 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | +119% | Opus 4.8: 48.8 |
| Agents’ Last Exam | 28.5 | 23.8 | +19.7% | GPT-5.6 Sol: 28.6 |
| ProgramBench | 19.0 | 9.5 | +100% | Fable 5: 33.0 |
Terminal Bench 3.0 的 6 倍提升尤其引人注目,这表明 GLM-5.3 在处理复杂终端任务方面取得了质的飞跃。
网络安全:意外涌现的能力
最令人惊讶的发现:随着后训练规模扩大,网络安全能力的发展速度远超预期。
| 基准测试 | GLM-5.3 | GLM-5.2 | 提升 | 说明 |
|---|---|---|---|---|
| CyberGym | 84.5% | 77.2% | +9.5% | 当前最佳,超越 Mythos 5 (83.8%) 和 GPT-5.6 Sol (83.6%) |
| ExploitBench | 54.4% | 24.4% | +123% | 漏洞利用能力翻倍以上 |
| ExploitGym (2h/6h) | 105/130 | 29/39 | +262%/+233% | 时间归一化预算下的任务完成数 |
关键洞察:越接近完整利用链顶端的基准测试,GLM-5.3 相对于 GLM-5.2 的提升越大——但同时与闭源前沿模型的差距也越大。能力增长最快的领域正是当前差距最大的领域。
从孤立缺陷识别到完整利用链规划
GLM-5.3 不仅仅是更好地识别孤立漏洞,而是开始: - 跨多个利用阶段进行推理 - 形成完整利用链的连贯计划 - 在复杂场景下执行端到端攻击
智能体能力
| 基准测试 | GLM-5.3 | GLM-5.2 | 提升 |
|---|---|---|---|
| Toolathlon Verified | 73.0% | 59.9% | +21.9% |
| AutomationBench v1.0.6 | 48.2% | 26.2% | +83.9% |
| HLE w/ Tools | 62.5% | 54.7% | +14.3% |
Z.ai Code Bench:真实场景评估
为了更准确地评估真实用户体验,Z.ai 引入了内部基准测试 Z.ai Code Bench:
- 评估维度:端到端任务完成率 + 细粒度检查清单准确率
- 环境设置:复杂的本地开发环境
- 优势:作为私有基准,减少公共测试集污染风险
性能与效率双提升
GLM-5.3 在每个 effort 级别上都实现了更高的性能和更低的 token 消耗:
| Effort 级别 | GLM-5.3 性能 | GLM-5.3 Tokens | GLM-5.2 性能 | GLM-5.2 Tokens |
|---|---|---|---|---|
| Max | 34.5% | ~75K | 23.4% | ~96K |
| High | 31.4% | ~50K | - | - |
对比闭源模型: - GLM-5.3 High (31.4%, ~50K tokens) > Claude Opus 4.8 (29.5%, 120K tokens) - 但仍落后于 Claude Fable 5 (39.5% at Max effort)
真实漏洞发现成果
GLM-5.3 的能力不仅体现在基准测试上,更在真实世界中得到验证:
发现统计
- 总漏洞数:2,436 个
- 涉及项目:269 个
- 中高危漏洞:1,097 个
- 覆盖领域:系统内核、操作系统、浏览器引擎、开源基础设施、Web应用、网络协议
- 最古老漏洞:约 40 年前引入(1981年)
- 平均潜伏时间:26.6 年
Z.ai 安全披露账本
智谱AI建立了 Z.ai Security Disclosure Ledger 来跟踪这些漏洞的披露过程: - 持续更新漏洞审查和披露状态 - 区分已公开和仍在披露流程中的问题 - 记录受影响项目、严重程度、CVE编号和潜伏时间
slime:长程 RL 扩展框架
GLM-5.3 的所有训练都运行在 slime 开源后训练框架上:
架构设计
1 | |
GLM-5.3 新增能力
算法侧: | 功能 | 说明 | |——|——| | top-p mask | 更精细的采样控制 | | top-k / 全词表 OPD | 灵活的在线策略蒸馏 | | R3-style 配置 | 改善训练-推理一致性 | | 完整数值对齐 | 训练和推理路径的数值完全对齐 |
训练-推理一致性:logprob 平均差异控制在 1e-7 级别,相比之前降低 99.99% 以上。
系统侧:
| 优化 | 效果 |
|---|---|
| 分层本地存储缓存 | 模型状态和数据层次化存储,减少主机内存占用 |
| 多教师 OPD 动态切换 | 无需为每个教师单独启动推理服务 |
| 路由器和 slime 联合调度 | 处理长度差异大的 rollout 请求 |
| 负载感知启发式 | 根据环境特征推导吞吐量优化配置 |
性能提升:长程代码 RL 任务端到端训练吞吐量提升 2.3 倍以上。
API 变更与使用指南
思考模式调整
GLM-5.3 不再支持禁用思考,始终启用 thinking,但提供三个 effort 级别:
| 参数 | 可选值 | 默认值 | 说明 |
|---|---|---|---|
thinking.type |
enabled |
enabled |
必须设置为 enabled |
reasoning_effort |
low / high / max |
max |
代码任务推荐 max |
迁移注意:如果当前使用
thinking.type: "disabled",需要先改为 enabled
并设置 reasoning_effort: "low",再更新模型 ID。
与编程工具集成
GLM-5.3 已集成到主流编程智能体: - ZCode(智谱官方) - Claude Code - OpenCode
GLM Coding Plan 订阅者权益: - 98%+ 缓存命中率,~30% 有效 token 提升 - 限时 1.5x 配额加成(可与缓存叠加,最高 180%) - Goal 模式:规划、编码、测试、验证直至目标完成 - Remote Control:通过微信/飞书远程监控长程任务
关键洞察与启示
1. 后训练 Scaling 的幂律
GLM-5.3 证明:在成熟的基础模型上,持续扩大后训练规模可以产生显著的能力跃迁。这与近期其他研究(如 Kimi K3)形成呼应,表明后训练正在成为大模型能力提升的主战场。
2. 环境是新的瓶颈
“As agent capability improves, much of the difficulty in scaling post-training moves from the model to the environment.”
有用的任务环境必须满足: - 可执行(executable) - 可验证(verifiable) - 接近真实专业工作(close to real professional work)
且需要大量这样的环境,而非少数手工构建的示例。
3. 网络安全能力的涌现特性
网络安全能力的发展呈现出非线性增长特征: - 初期:更好的漏洞识别 - 临界点:开始形成完整利用链的推理能力 - 后期:在真实场景中系统性发现漏洞
这种模式提示我们:某些能力可能只在特定训练规模后才显现。
4. 评估基准的局限性
智谱团队指出公共编码基准测试的问题: - 易受污染(contamination-prone) - 无法很好反映用户对编程智能体的实际需求
因此他们建立了私有基准 Z.ai Code Bench,这提示研究者和从业者:真实场景评估可能比公开排行榜更重要。
总结
GLM-5.3 代表了开源大模型在后训练 scaling 方面的重要里程碑。它的核心贡献在于:
- 实证了纯后训练 scaling 的潜力:相同基础模型,仅通过后训练扩展即可实现 6 倍以上的特定任务提升
- 揭示了网络安全能力的涌现路径:从孤立漏洞识别到完整利用链规划的质变
- 建立了真实漏洞发现的实际应用:2,436 个漏洞的发现证明了模型在实际安全领域的价值
- 开源了完整的技术栈:slime 框架为社区提供了长程 RL 扩展的基础设施
对于研究者和从业者,GLM-5.3 的发布意味着: - 开源模型在代码和网络安全领域正快速追赶闭源前沿 - 后训练和环境工程正在成为大模型开发的核心竞争力 - 智能体能力的评估需要更多真实场景、更少基准刷分
权重将在安全评估完成后两周内开源,届时社区可以进一步探索这一模型的能力边界。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。