GLM-5.3 正式发布:前沿编程能力与涌现的网络安全能力

GLM-5.3 正式发布。基座不变,后训练极致 Scaling,开源编程第一,涌现网络安全能力持平 Mythos 5,两周内开放权重。

先说结论: GLM-5.3 于 2026 年 8 月 14 日正式发布。基座模型和 GLM-5.2 完全相同(744B/40B MoE + IndexShare),所有提升来自后训练 Scaling——数十倍的长程任务环境、更丰富的环境类型、超长训练时间。结果:开源编程能力第一,网络安全能力涌现到持平 Mythos 5 的白盒代码审计水平。权重两周内开源。

5.2 到 5.3:变了什么

基座一个字没动——744B 总参数、40B 激活的 MoE,IndexShare 架构原封不动。所有进步来自后训练:

  • 数十倍的长程任务环境——有些任务相当于工程师连续数天的工作量
  • 更丰富的环境类型——ML 优化集群、安全分析框架、真实开发工具链
  • 持续 RL 训练——基于 IndexShare、SAO、以及新一代 Slime 框架

智谱自己的说法:这个基座的智能上界,可能远没被开发完。

Benchmark:开源编程第一

基准GLM-5.2GLM-5.3提升说明
Terminal-Bench 3.04.628.3+515%真实终端复杂任务
DeepSWE v1.146.266.9+45%长程软件工程
Agents’ Last Exam (CLI)23.828.5+20%跨工具协作、长程任务
GDPval-AA v2176944 种职业的高价值知识工作
Z.ai Code Bench (High)31.4%超过 Claude Opus 4.8 的 29.5%

Z.ai Code Bench 的结果值得注意:GLM-5.3 在 High 档位下用约 5 万 token 达到 31.4% 准确率,而 Opus 4.8 需要约 12 万 token 才达到 29.5%。意味着 GLM-5.3 能找到更短的执行路径。

涌现的网络安全能力

Z.ai OpenVuln on HuggingFace Z.ai 在 HuggingFace 上的 OpenVuln 空间——基于 GLM-5.3 为开源项目提供持续安全审计。

这是最意外的亮点。智谱并没有专门为网络安全训练——它从编程能力在更受约束的环境中推进时涌现了出来。他们的判断:“安全工作本质上是约束严格的编程能力。“

基准GLM-5.2GLM-5.3Mythos 5GPT-5.6 Sol任务
CyberGym77.2%84.5%83.8%83.6%白盒代码审查 → 触发故障 → 识别漏洞
ExploitBench24.4%54.4%78.0%76.5%理解真实漏洞 → 编写利用
ExploitGym (2h)29 项105 项181 项定时漏洞利用吞吐量
ExploitGym (6h)39 项130 项247 项扩展时间预算

趋势很清楚:越接近漏洞发现链的前端(代码审查、漏洞识别),GLM-5.3 越强,CyberGym 上甚至超过了 Mythos 5。越深入完整利用,和闭源前沿模型的差距越大。换句话说,进步最快的方向,正是还需要继续追赶的方向。

真实漏洞发现成果

从 GLM-5.2 发布以来,联合清华、南开以及多家安全团队的成果:

  • 2,436 个漏洞(经去重)
  • 1,097 个中高危
  • 部分漏洞潜伏长达 45 年
  • 涵盖 269 个项目:系统内核、浏览器、操作系统、互联网协议
  • 参考全球漏洞交易市场报价,经济价值约 3000 万元

标志性案例:

  • DNS 协议漏洞(潜伏约 40 年):放大因子最高 8 万倍,可能影响全球 90%+ 的 DNS 系统
  • Cursor IDE 漏洞:Rust/Electron 混合架构中的权限校验风险
  • 国民级通信软件漏洞:零点击远程利用,无需诱导用户任何操作
  • 微软 Exchange 级漏洞:3 个关键漏洞,微软官方致谢”Kunlun Lab & GLM”
  • 人形机器人漏洞:可远程同时劫持上千台机器人

”开源的盾”计划

智谱把 GLM-5.3 的安全能力定位为开源公共品,明确对标 Anthropic 仅向约 150 家大型机构提供 Mythos 的模式:

  1. 对重点开源项目持续安全审计(免费):OpenVuln on HuggingFace
  2. 向开源维护者免费提供模型额度(安全审计和防御任务)
  3. ZCode 内置代码审计功能——安全检查进入日常研发流程

上线时间表

渠道状态时间
ZCode(编码工具)✅ 已上线8 月 14 日
AutoClaw(效率工具)✅ 已上线8 月 14 日
GLM Coding Plan✅ 全量用户 + 开放订阅8 月 14 日
第三方工具✅ 抢先体验TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode
API🔜 即将上线近期
开源权重🔜 两周内安全加固后(约 8 月 28 日)

技术路线:后训练,不是预训练

GLM-5 GitHub 仓库 GitHub zai-org/GLM-5——GLM-5.3 权重将在两周内发布到这里。

GLM-5.3 的关键技术故事:所有提升来自后训练,不是更大的预训练数据或参数。

训练环境不是做题。模型被放进和算法工程师完全相同的环境——计算集群、存储系统、内部文档、代码库和实验结果——端到端执行可量化的优化任务。有些任务相当于工程师数天的连续工作。

模型学到的不只是执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作。

安全架构

GLM-5.3 的风险审查系统采用纵深防御:

层级职责方式
外层分类器拦截大规模滥用轻量模型,高吞吐
推理监控器实时审查任务意图推理过程中判断危害
深度安全对齐模型自主拒绝攻击请求开源权重场景下唯一有效防线

审查以意图为中心而非关键词——因为攻防代码在字面上高度相似。风险按任务类型分级:安全知识问答、蓝队防御、CTF、漏洞发现/修复、漏洞利用、渗透测试、真实入侵,每类有独立的阈值。

最敏感能力仅通过”网络安全受信访问”计划向经过验证的用户开放。

GLM-5.2 → GLM-5.3 对比

规格GLM-5.2GLM-5.3
基座参数744B(40B 激活)744B(40B 激活)——相同
架构IndexShare MoEIndexShare MoE——相同
上下文窗口100 万 token100 万 token——相同
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
CyberGym77.2%84.5%
ExploitBench24.4%54.4%
许可证Apache-2.0预期 Apache-2.0(待确认)
权重开放两周内开放
核心创新IndexShare 架构后训练 Scaling 到智能上界

对开发者意味着什么

正在用 GLM-5.2: API 兼容性预期一致。等 API 上线后在 staging 测试。

需要开源权重: 两周等待期(安全加固)。开放的权重会包含限制攻击性使用同时保留防御能力的安全对齐。

在做安全工具: 代码审查、漏洞扫描、防御分析方面 GLM-5.3 立即可用且很有竞争力。完整的漏洞利用开发,Mythos 5 仍然领先。

在 SandBase 上: API 公开后会第一时间加入模型目录。GLM-5.2 目前已可用。

GLM-5.1 的详细分析见 GLM-5.1 开源权重深度解读。开源权重模型横向对比见 2026 年 8 月最佳开源 LLM(Agent 向)

FAQ

GLM-5.3 是新架构吗?

不是。基座和 GLM-5.2 完全相同。所有提升来自后训练 RL Scaling。

API 什么时候能用?

智谱说”很快”——预计天级别。ZCode 和 AutoClaw 已经上线了。

权重什么时候开放?

从 8 月 14 日算起两周内,约 8 月 28 日。需要先完成安全加固。

打得过 Claude Fable 5 吗?

在 Z.ai Code Bench 上 GLM-5.3(31.4%)超过了 Opus 4.8(29.5%),而且 token 用量少 60%。但在公开基准上还没有和 Fable 5 直接对比过。整体编程能力接近 Claude Fable 5,体感超过其他国产模型——这是智谱自己的说法。

能用来做攻击性安全工作吗?

安全系统限制了攻击性能力。防御性使用(代码审查、漏洞扫描、补丁开发)完全支持。攻击性能力需要通过智谱的”网络安全受信访问”验证。