GLM-5.3 发布:后训练驱动的编程与安全双跃升
8 月 14 日,智谱 AI 正式发布 GLM-5.3。这款模型没有更换底座,所有提升都来自后训练阶段的强化学习。在编程能力上,它比 GLM-5.2 提升了 50%,在网络安全漏洞挖掘方面也达到了开源模型的新高度。
底座不变,后训练拉满
GLM-5.3 和 GLM-5.2 共享同一个底座模型。智谱 AI 的做法是持续扩大后训练的规模:更多的任务环境、更丰富多样的任务类型,以及更多的训练算力。他们把这套后训练技术栈叫做 slime,结合了 Megatron 做训练、SGLang 做推理,让数学、代码、沙箱、验证器和长时间任务环境都能作为数据生成环节接入,而不需要改动训练循环本身。
从 GLM-5.2 到 GLM-5.3,智谱 AI 在三个方向上扩展了后训练环境。一是把任务从编程练习推向更接近实际工程师工作量的场景,有些任务相当于一个有经验工程师几天的工作量。二是在训练中引入了漏洞发现数据,结果网络安全能力增长得比预期快得多。三是保持了 GLM-5.2 引入的 SAO(带压缩的长上下文强化学习)策略,让模型在长时间任务上的增益不只是短任务。
编程:开源新标杆
GLM-5.3 在多项编程基准测试中拿到了开源最好成绩:
- Terminal Bench 3.0 得分 28.3,比 GLM-5.2 的 4.6 提升了 6 倍多。这个分数超过了 Kimi K3(17.4)和 Claude Opus 4.8(21.1),但仍落后于 GPT-5.6 Sol(34.6)和 Claude Fable 5(33.7)。
- DeepSWE v1.1 得分 66.9,GLM-5.2 是 46.2,提升 45%。
- Agents' Last Exam 得分 28.5,超过了 Kimi K3(27.6)和 Claude Opus 4.8(25.7)。
智谱 AI 还推出了自己的内部基准测试 Z.ai Code Bench,在不同难度等级下评估端到端任务完成率和细粒度检查清单准确率。在 Max 难度下,GLM-5.3 用大约 75K 输出 token 达到了 34.5% 的完成率,而 GLM-5.2 在 96K token 下只有 23.4%。相比之下,Claude Opus 4.8 在 120K token 下达到 29.5%,Claude Fable 5 在 Max 难度下达到 39.5%。
Token 效率方面的提升也值得注意。GLM-5.3 用了更少的 token 拿到了更高的分数,说明后训练不仅提升了能力上限,也让推理更高效。
网络安全:从漏洞识别到完整利用链
GLM-5.3 最让人意外的能力增长出现在网络安全领域。智谱 AI 在后训练中加入了漏洞发现数据和环境,本意是让模型更好地识别和分析漏洞。但随着训练规模扩大,模型开始展现出超出预期的能力:它不只是能发现孤立的漏洞,而是能跨多个阶段推理,形成完整的利用链。
在三个网络安全基准测试上的表现:
- CyberGym(白盒源码漏洞发现):84.5%,比 GLM-5.2 的 77.2% 提升了 7 个百分点。这个分数是所有模型中最高的,超过了 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
- ExploitBench(深度漏洞利用推理):54.4%,比 GLM-5.2 的 24.4% 翻了一倍多。但与 Mythos 5(78.0%)和 GPT-5.6 Sol(76.5%)还有明显差距。
- ExploitGym(时间预算下的利用任务完成数):2 小时完成 105 个任务、6 小时完成 130 个。GLM-5.2 只能完成 29 和 39 个。Mythos 5 以 181 和 247 领先。
这个模式很有意思:越接近真实攻击链的基准测试,GLM-5.3 相对 GLM-5.2 的提升越大,但与闭源前沿模型的差距也越大。能力增长最快的恰恰是差距最大的地方。
在实际漏洞挖掘中,GLM-5.3 在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危漏洞。最老的一个漏洞可以追溯到 1981 年,平均每个漏洞潜伏了 26.6 年才被发现。
使用方式和定价
GLM-5.3 目前可通过 Z.ai API 和 ZCode IDE 使用。在 OpenRouter 上也可以调用,定价为输入 $1.40/百万 token、输出 $4.40/百万 token,支持 100 万 token 上下文窗口。
模型有三个推理力度等级:low(轻量)、high(增强)、max(深度),其中 high 推荐用于编程任务。GLM-5.3 不再支持关闭思考模式。
智谱 AI 表示会在发布后两周内开放模型权重。权重发布前会完成安全评估和加固。
总结
GLM-5.3 证明了一件事:在底座模型不变的情况下,后训练的规模扩展仍然有很大的提升空间。编程能力 50% 的提升、网络安全能力的意外爆发、Token 效率的显著改善,这些都来自同一个技术方向——用更多、更复杂的环境去训练同一个底座。
网络安全能力的涌现尤其值得关注。当模型开始能推理完整的攻击链时,攻防格局可能正在改变。智谱 AI 已经在 269 个开源项目中找到了 2,436 个漏洞,其中 53 个已经公开披露。这个数字还在增长。




