★GLM-5.3:后训练规模化的产物,代码能力提升 50%,涌现出意外的网络攻防能力★
智谱 AI 今天发布了 GLM-5.3。这次发布有些特别——模型基座和 5.2 完全一样,所有提升都来自后训练阶段的规模化扩展。
结果有点出人意料:代码能力涨了 50% 不稀奇,但网络攻防能力(Cyber Capability)的增长速度比预想中快得多。在漏洞发现和利用链的完整推理上,GLM-5.3 的表现已经明显超出了”纯代码模型”的范畴。
另一个值得注意的变化是 API 行为:thinking.type: "disabled" 不再支持,必须切换到思考模式才能调用。这个改动会影响所有现有接入代码,迁移时需要注意。
为什么后训练能撑起一次版本更新
GLM-5.3 的基座和 5.2 是同一个。所有性能提升都来自后训练阶段(post-training)的继续投入:更多环境、更多样化的任务、更多计算资源。
这听起来像是”大力出奇迹”,但实际上在规模化后训练之前,得先把基础设施搭稳。GLM-5.2 那会儿已经铺好了三块基石:
- 🍄
IndexShare:长上下文的高效处理机制,解决长序列下的注意力计算瓶颈; - 🍄
SAO(with compaction) :长周期任务的 RL 训练算法,避免长序列上的梯度消失和 credit assignment 问题; - 🍄
slime:开源的大规模异步 RL 训练框架,让训练、推理、数据交换跑在同一条流水线上。
GLM-5.3 做的就是在这套堆栈上继续推进:环境覆盖面更广,任务多样性更高,算力投入更大。
代码能力:更接近真实工程师的工作方式
GLM-5.3 在内部 Z.ai Code Bench 上比 GLM-5.2 提升了 50%。这个内部基准测试的特点在于:它不是代码补全或单文件修复,而是把 agent 放进一个完整的本地开发环境里,模拟真实用户场景下的端到端任务。
几个公开基准的表现:
Terminal Bench 3.0 从 4.6 跳到 28.3,这个跨度说明了什么?Terminal Bench 测试的是 agent 在终端环境里完成复杂的、多步骤的工程任务,涉及多文件修改、依赖管理、服务启动与调试。GLM-5.2 几乎做不了这种任务,而 GLM-5.3 能完成近三分之一。
这背后是训练环境的设计思路变了。
GLM-5.3 的训练环境不再围绕”代码练习题”来构造,而是模拟真实生产工作流。举个例子:一个 ML 基础设施任务里,模型会得到一个工程师的完整工作环境——计算集群、存储系统、内部文档、代码库、历史实验记录。任务目标是诊断训练栈的性能瓶颈、实现优化、跑实验验证、最终交付可测量的端到端加速,同时保证正确性。
这类任务本身可能对应一个工程师几天的工作量。模型在这样的环境里训练,学会的是”对一整个项目负责”,而不是等用户把问题拆碎了一步一步喂给它。
环境规模化怎么做
当 agent 能力提升到一定程度后,后训练规模化的瓶颈就从模型本身转移到了环境上。
一个可用的训练环境需要同时满足三个条件:可执行(能真正跑起来)、可验证(有明确的成功/失败判定)、贴近真实工作。而且要很多个,不是一两个手工搭建的 demo。
GLM-5.3 的做法是构建了一套合成流水线:
-
研究 agent 从真实工作中收集任务模式; -
将这些模式转化为可运行的长周期环境,包含多步依赖和隐藏状态; -
一个 judge agent 尝试执行每个任务,验证它确实可解; -
验证器(verifier)在不知道参考答案的情况下被合成; -
用 solver 的轨迹来发现并堵住 reward shortcuts。
最终产出的 verifier 需要通过 oracle、no-op、unsolved-state 三重检查,然后产生一个足够可靠的二元 reward 信号,直接用于 RL 训练。
这套流程目前仍然需要相当规模的人工介入,但方向是让环境生成和验证变得更加自主。
写更少代码,做更多事
一个值得注意的指标是 token 效率。
在 Z.ai Code Bench 上,GLM-5.3 在每个 effort 级别上都比 GLM-5.2 用更少的输出 token 完成更高的任务成功率。Max effort 下,GLM-5.3 达到 34.5% 成功率,输出约 75K token;而 GLM-5.2 是 23.4%,需要 96K token。
和闭源模型对比:High effort 下,GLM-5.3 达到 31.4%,输出约 50K token;Claude Opus 4.8 是 29.5%,但需要 120K token。Claude Fable 5 在 Max effort 下仍领先,达到 39.5%。
这意味着 GLM-5.3 在同等 token 预算下能完成更复杂的任务,对长上下文场景和成本敏感的生产环境都比较友好。
网络攻防能力:从漏洞发现到利用链推理
这部分是这次发布最值得关注的地方。
智谱在 post-training 的数据 mix 里加入了漏洞发现相关的数据和环境。预期是让模型更擅长识别和推理漏洞,但实际效果超出了预期——GLM-5.3 不仅更会找漏洞,而且开始能跨多个阶段推理完整的 exploitation chain。
三个基准,一个趋势
GLM-5.3 在三个不同层次的网络攻防基准上做了评估:
这三个基准分别对应不同的难度层级:
- 🍄
CyberGym:从白盒源码出发,测试模型能否识别并触发漏洞来验证其可利用性。GLM-5.3 在这个基准上已经超过了所有对比的闭源模型,包括 Mythos 5 和 GPT-5.6 Sol。 - 🍄
ExploitBench:需要更深入的推理——真实漏洞的利用方式、多步骤的 exploitation 路径规划。GLM-5.3 从 24.4% 翻倍到 54.4%,但闭源模型(Mythos 5 78.0%,GPT-5.6 Sol 76.5%)仍有明显差距。 - 🍄
ExploitGym:在时间归一化预算内能完成多少 exploitation 任务。GLM-5.3 在 2 小时内完成 105 个任务,6 小时内 130 个,比 GLM-5.2 提升了 2.6 倍。Mythos 5 仍然领先,分别完成 181 和 247 个。
一个清晰的模式出现了:越往 exploitation chain 的上游走(从漏洞发现到利用链构建),GLM-5.3 的提升幅度越大,但和闭源前沿的差距也越大。能力增长最快的方向,恰恰是目前最落后的方向。
真实代码库的发现
基准测试是一回事,真实代码库是另一回事。
从 GLM-5.2 开始,智谱就和国内多个安全团队合作,在真实代码库上运行模型。经过专家复核、筛查和去重后,模型在 269 个项目中识别出 2,436 个漏洞,其中 1,097 个被评为中高严重性。
这些发现覆盖了系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。其中很多漏洞在代码库中存在了数年甚至数十年——最老的可以追溯到 1981 年引入,平均每个漏洞在代码库中存活了 26.6 年才被发现。
智谱为此建立了 Z.ai Security Disclosure Ledger(安全披露分类账),公开记录这些发现的披露进度。目前已公开披露 53 个,其余 2,383 个仍在 embargo 期。
严重性分布
107 个严重(Critical)、990 个高危(High)、1,286 个中危(Medium)、53 个低危(Low)。
引入时间的跨度从 1981 年到 2026 年。
这个数据量级意味着什么?一个模型在 post-training 阶段接触了漏洞相关的数据和环境之后,获得了在真实代码库中进行规模化漏洞发现的能力。但需要注意,这是经过专家复核和筛查的结果,不是模型直接输出的原始结果。
slime:让 RL 规模化成为可能的基础设施
所有这些训练都跑在 slime 上——智谱开源的后训练 RL 框架。
slime 的架构设计有个关键选择:训练、推理 rollout、数据 buffer 都跑在同一条数据流(dataflow)上。这意味着新增一个环境、一个 verifier、一个 sandbox,都只需要作为数据生成逻辑接入,不需要改动训练循环本身。这就是为什么从 GLM-5.2 到 GLM-5.3 可以持续堆环境而不需要重建训练栈。
GLM-5.3 的开发过程中,slime 在两个方向上继续推进:
算法侧:新增了 top-p mask、top-k 和 full-vocabulary OPD(off-policy distribution),以及 R3 风格的训练-rollout 一致性配置。目标是让采样、训练、teacher signal 的控制更精细,方便做对照实验。最终在训练-rollout 一致性评估中,logprob 的平均差异被控制在 1e-7 级别,相比之前减少了 99.99%。
系统侧:本地存储被用作额外的缓存层,分层存放模型状态和数据,减少 host memory 压力。这对 multi-teacher OPD 尤其重要——多个 teacher 可以动态切换和预取,不需要为每个 teacher 单独部署一个长驻推理服务,显著降低了资源消耗。
对于 agentic 和异步负载,router 和 slime 之间的调度和负载均衡做了改进,让不同长度的 rollout 请求能更充分利用推理资源。还加入了 workload-aware 的启发式配置,根据每个 rollout 环境的特征自动推导 prefill/decode 资源比例、并发数等吞吐关键参数。
综合效果:在长周期 coding RL 任务上,这些系统级优化让端到端的 RL 训练吞吐提升了 2.3 倍以上。
上手 GLM-5.3
API 变化:thinking 不能关了
GLM-5.3 支持三个思考强度级别:low、high、max。不再支持 thinking.type: "disabled"。
调用示例:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
迁移提醒:如果你现有代码用了 thinking.type: "disabled",需要在更新 model ID 到 glm-5.3 之前,先改成 enabled 并将 reasoning_effort 设为 low,否则请求会失败。
使用渠道
- 🍄
GLM Coding Plan:已切换到点数制配额,输入/缓存输入/输出分别计费。非高峰时段(工作日 14:00-18:00 之外的时段,含周末)消耗 50% 点数。 - 🍄
ZCode:GLM-5.3 已接入,支持 Goal mode(计划-编码-测试-验证循环)和远程控制(微信/飞书监控长任务)。缓存命中率 98%+,8 月 31 日前有 1.5 倍配额加成。 - 🍄
本地部署:权重将在发布后两周内公开。
速览清单
- 🍄
[ ] GLM-5.3 基座与 5.2 相同,所有提升来自后训练规模化 - 🍄
[ ] Terminal Bench 3.0 从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9 - 🍄
[ ] Z.ai Code Bench 上 50% 相对提升,同时输出 token 更少 - 🍄
[ ] CyberGym 84.5% 当前 SOTA,超过所有对比闭源模型 - 🍄
[ ] 真实代码库中发现 2,436 个漏洞,含 1,097 个中高危,最老漏洞可追溯至 1981 年 - 🍄
[ ] thinking.type: "disabled"不再支持,迁移前需先切到enabled - 🍄
[ ] slime 框架吞吐提升 2.3 倍以上,权重将在两周后开源
FAQ
Q:GLM-5.3 的 API 和之前版本最大的区别是什么?
thinking.type: "disabled" 不再被支持。所有请求必须启用思考模式,可以设置 reasoning_effort 为 low、high 或 max。如果现有代码仍使用 disabled,更新模型 ID 后请求会失败。
Q:reasoning_effort 的三个级别应该怎么选?
max 适合 coding 和复杂推理任务;high 适合一般 agent 任务;low 适合简单问答或对延迟敏感的场景。Coding 任务官方推荐用 max。
Q:GLM-5.3 在 Terminal Bench 3.0 上 28.3% 算什么水平?
在开源权重模型中是最高的。但闭源模型中 Fable 5(33.7%)和 GPT-5.6 Sol(34.6%)仍然领先。
Q:网络攻防能力是 GLM-5.3 专门训练出来的吗?
不是专门训练的。智谱在 post-training 的数据 mix 里加入了漏洞发现相关数据,期望是让模型更擅长漏洞推理,但实际涌现出的 exploitation chain 推理能力比预期更强。智谱明确表示将在权重发布前完成安全评估和加固。
Q:slime 是什么?我需要单独装吗?
slime 是智谱开源的 RL 后训练框架,用于大规模异步训练。如果你想在 GLM-5.3 基础上做自己的 RL 训练,可以用;如果只是调用 API 或本地推理,不需要关注。
Q:权重什么时候能下载?
发布后两周内公开,届时可在官方渠道获取。
Q:Z.ai Code Bench 是什么?为什么其他模型没有这个分数?
Z.ai Code Bench 是智谱内部的 coding agent 评估基准,场景更接近真实用户工作流,且作为私有基准可以避免公开数据集的污染问题。其他模型的分数不在本次发布中公开。

