GLM-5.3 开源权重发布:后训练驱动,编码与网络安全双线突破

8 月 28 日,智谱 AI 在 Hugging Face 上开放了 GLM-5.3 的模型权重。这款 8 月 14 日首次发布的模型,所有能力提升都来自后训练阶段,底座模型与 GLM-5.2 完全相同。开放权重后,社区可以通过 SGLang、vLLM、Transformers 等框架在本地部署。

底座没变,后训练拉满

GLM-5.3 和 GLM-5.2 共享同一个底座。智谱 AI 的做法是持续扩大后训练的规模和复杂度:更多的任务环境、更丰富多样的任务类型、更多的训练算力。他们把这套后训练技术栈叫做 slime,结合 Megatron 做训练、SGLang 做推理,让数学、代码、沙箱、验证器和长时间任务环境都能作为数据生成环节接入。

从 5.2 到 5.3,三个方向被扩展了。一是把任务从编程练习推向更接近真实工程师工作量的场景,有些任务相当于一个有经验工程师几天的工作量。二是在训练中引入了漏洞发现数据,结果网络安全能力增长得比预期快得多。三是保持了 SAO(带压缩的长上下文强化学习)策略,让模型在长时间任务上的增益不只是短任务。

编程:开源新标杆

GLM-5.3 在多项编程基准测试中拿到了开源最好成绩:

  • Terminal Bench 3.0 得分 28.3,比 GLM-5.2 的 4.6 提升了 6 倍多。超过 Kimi K3(17.4)和 Claude Opus 4.8(21.1),但仍落后于 GPT-5.6 Sol(34.6)和 Claude Fable 5(33.7)。
  • DeepSWE v1.1 得分 66.9,GLM-5.2 是 46.2,提升 45%。
  • Agents' Last Exam 得分 28.5,超过了 Kimi K3(27.6)和 Claude Opus 4.8(25.7)。
  • Terminal Bench 2.1 得分 88.2,与 GPT-5.6 Sol(88.8)和 Kimi K3(88.3)接近。

智谱 AI 的内部基准 Z.ai Code Bench 在 Max 难度下,GLM-5.3 用大约 75K 输出 token 达到 34.5% 完成率,而 GLM-5.2 在 96K token 下只有 23.4%。Claude Opus 4.8 在 120K token 下是 29.5%,Claude Fable 5 达到 39.5%。Token 效率的提升说明后训练不仅拉高了上限,也让推理更高效。

网络安全:从漏洞识别到完整利用链

最让人意外的进展出现在网络安全领域。智谱 AI 在后训练中加入了漏洞发现数据和环境,本意是让模型更好地识别和分析漏洞。但随着训练规模扩大,模型开始展现出超出预期的能力:它不只是能发现孤立的漏洞,而是能跨多个阶段推理,形成完整的利用链。

三个网络安全基准的表现:

  • CyberGym(白盒源码漏洞发现):84.5%,比 GLM-5.2 的 77.2% 高 7 个百分点。这个分数是所有模型中最高的,超过了 Claude Fable 5(83.8%)和 GPT-5.6 Sol(83.6%)。
  • ExploitBench(深度漏洞利用推理):54.4%,比 GLM-5.2 的 24.4% 翻了一倍多。但与 Claude Fable 5(78.0%)和 GPT-5.6 Sol(76.5%)还有明显差距。
  • ExploitGym(时间预算下的利用任务完成数):2 小时完成 105 个、6 小时完成 130 个。GLM-5.2 只能完成 29 和 39 个。

这个模式很有意思:越接近真实攻击链的基准测试,GLM-5.3 相对 GLM-5.2 的提升越大,但与闭源前沿模型的差距也越大。能力增长最快的地方恰恰也是差距最大的地方。

在实际漏洞挖掘中,GLM-5.3 在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危漏洞。最老的一个漏洞可以追溯到 1981 年,平均每个漏洞潜伏了 26.6 年。

部署方式和定价

开放权重后,GLM-5.3 可以通过 SGLang、vLLM、Transformers、KTransformers、Unsloth 等框架本地部署。智谱 AI 还提供了 TokenSpeed 和官方 Cookbook 作为参考。

通过 API 调用的话,OpenRouter 上的定价是输入 $1.40/百万 token、输出 $4.40/百万 token,支持 130 万 token 上下文窗口。模型有三个推理力度等级:low(轻量)、high(增强)、max(深度),编程任务推荐用 high。

总结

GLM-5.3 证明了一件事:在底座模型不变的情况下,后训练的规模扩展仍然有很大的提升空间。编程能力 50% 的提升、网络安全能力的意外爆发、Token 效率的显著改善,这些都来自同一个技术方向。开源权重的发布意味着社区可以直接使用和微调这个模型,对开源生态是个好消息。