GLM-5.3 正式发布:前沿编程能力与涌现的网络安全能力
GLM-5.3 正式发布。基座不变,后训练极致 Scaling,开源编程第一,涌现网络安全能力持平 Mythos 5,两周内开放权重。
先说结论: GLM-5.3 于 2026 年 8 月 14 日正式发布。基座模型和 GLM-5.2 完全相同(744B/40B MoE + IndexShare),所有提升来自后训练 Scaling——数十倍的长程任务环境、更丰富的环境类型、超长训练时间。结果:开源编程能力第一,网络安全能力涌现到持平 Mythos 5 的白盒代码审计水平。权重两周内开源。
5.2 到 5.3:变了什么
基座一个字没动——744B 总参数、40B 激活的 MoE,IndexShare 架构原封不动。所有进步来自后训练:
- 数十倍的长程任务环境——有些任务相当于工程师连续数天的工作量
- 更丰富的环境类型——ML 优化集群、安全分析框架、真实开发工具链
- 持续 RL 训练——基于 IndexShare、SAO、以及新一代 Slime 框架
智谱自己的说法:这个基座的智能上界,可能远没被开发完。
Benchmark:开源编程第一
| 基准 | GLM-5.2 | GLM-5.3 | 提升 | 说明 |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% | 真实终端复杂任务 |
| DeepSWE v1.1 | 46.2 | 66.9 | +45% | 长程软件工程 |
| Agents’ Last Exam (CLI) | 23.8 | 28.5 | +20% | 跨工具协作、长程任务 |
| GDPval-AA v2 | — | 1769 | — | 44 种职业的高价值知识工作 |
| Z.ai Code Bench (High) | — | 31.4% | — | 超过 Claude Opus 4.8 的 29.5% |
Z.ai Code Bench 的结果值得注意:GLM-5.3 在 High 档位下用约 5 万 token 达到 31.4% 准确率,而 Opus 4.8 需要约 12 万 token 才达到 29.5%。意味着 GLM-5.3 能找到更短的执行路径。
涌现的网络安全能力
Z.ai 在 HuggingFace 上的 OpenVuln 空间——基于 GLM-5.3 为开源项目提供持续安全审计。
这是最意外的亮点。智谱并没有专门为网络安全训练——它从编程能力在更受约束的环境中推进时涌现了出来。他们的判断:“安全工作本质上是约束严格的编程能力。“
| 基准 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol | 任务 |
|---|---|---|---|---|---|
| CyberGym | 77.2% | 84.5% | 83.8% | 83.6% | 白盒代码审查 → 触发故障 → 识别漏洞 |
| ExploitBench | 24.4% | 54.4% | 78.0% | 76.5% | 理解真实漏洞 → 编写利用 |
| ExploitGym (2h) | 29 项 | 105 项 | 181 项 | — | 定时漏洞利用吞吐量 |
| ExploitGym (6h) | 39 项 | 130 项 | 247 项 | — | 扩展时间预算 |
趋势很清楚:越接近漏洞发现链的前端(代码审查、漏洞识别),GLM-5.3 越强,CyberGym 上甚至超过了 Mythos 5。越深入完整利用,和闭源前沿模型的差距越大。换句话说,进步最快的方向,正是还需要继续追赶的方向。
真实漏洞发现成果
从 GLM-5.2 发布以来,联合清华、南开以及多家安全团队的成果:
- 2,436 个漏洞(经去重)
- 1,097 个中高危
- 部分漏洞潜伏长达 45 年
- 涵盖 269 个项目:系统内核、浏览器、操作系统、互联网协议
- 参考全球漏洞交易市场报价,经济价值约 3000 万元
标志性案例:
- DNS 协议漏洞(潜伏约 40 年):放大因子最高 8 万倍,可能影响全球 90%+ 的 DNS 系统
- Cursor IDE 漏洞:Rust/Electron 混合架构中的权限校验风险
- 国民级通信软件漏洞:零点击远程利用,无需诱导用户任何操作
- 微软 Exchange 级漏洞:3 个关键漏洞,微软官方致谢”Kunlun Lab & GLM”
- 人形机器人漏洞:可远程同时劫持上千台机器人
”开源的盾”计划
智谱把 GLM-5.3 的安全能力定位为开源公共品,明确对标 Anthropic 仅向约 150 家大型机构提供 Mythos 的模式:
- 对重点开源项目持续安全审计(免费):OpenVuln on HuggingFace
- 向开源维护者免费提供模型额度(安全审计和防御任务)
- ZCode 内置代码审计功能——安全检查进入日常研发流程
上线时间表
| 渠道 | 状态 | 时间 |
|---|---|---|
| ZCode(编码工具) | ✅ 已上线 | 8 月 14 日 |
| AutoClaw(效率工具) | ✅ 已上线 | 8 月 14 日 |
| GLM Coding Plan | ✅ 全量用户 + 开放订阅 | 8 月 14 日 |
| 第三方工具 | ✅ 抢先体验 | TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode |
| API | 🔜 即将上线 | 近期 |
| 开源权重 | 🔜 两周内 | 安全加固后(约 8 月 28 日) |
技术路线:后训练,不是预训练
GitHub zai-org/GLM-5——GLM-5.3 权重将在两周内发布到这里。
GLM-5.3 的关键技术故事:所有提升来自后训练,不是更大的预训练数据或参数。
训练环境不是做题。模型被放进和算法工程师完全相同的环境——计算集群、存储系统、内部文档、代码库和实验结果——端到端执行可量化的优化任务。有些任务相当于工程师数天的连续工作。
模型学到的不只是执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作。
安全架构
GLM-5.3 的风险审查系统采用纵深防御:
| 层级 | 职责 | 方式 |
|---|---|---|
| 外层分类器 | 拦截大规模滥用 | 轻量模型,高吞吐 |
| 推理监控器 | 实时审查任务意图 | 推理过程中判断危害 |
| 深度安全对齐 | 模型自主拒绝攻击请求 | 开源权重场景下唯一有效防线 |
审查以意图为中心而非关键词——因为攻防代码在字面上高度相似。风险按任务类型分级:安全知识问答、蓝队防御、CTF、漏洞发现/修复、漏洞利用、渗透测试、真实入侵,每类有独立的阈值。
最敏感能力仅通过”网络安全受信访问”计划向经过验证的用户开放。
GLM-5.2 → GLM-5.3 对比
| 规格 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| 基座参数 | 744B(40B 激活) | 744B(40B 激活)——相同 |
| 架构 | IndexShare MoE | IndexShare MoE——相同 |
| 上下文窗口 | 100 万 token | 100 万 token——相同 |
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
| 许可证 | Apache-2.0 | 预期 Apache-2.0(待确认) |
| 权重 | 开放 | 两周内开放 |
| 核心创新 | IndexShare 架构 | 后训练 Scaling 到智能上界 |
对开发者意味着什么
正在用 GLM-5.2: API 兼容性预期一致。等 API 上线后在 staging 测试。
需要开源权重: 两周等待期(安全加固)。开放的权重会包含限制攻击性使用同时保留防御能力的安全对齐。
在做安全工具: 代码审查、漏洞扫描、防御分析方面 GLM-5.3 立即可用且很有竞争力。完整的漏洞利用开发,Mythos 5 仍然领先。
在 SandBase 上: API 公开后会第一时间加入模型目录。GLM-5.2 目前已可用。
GLM-5.1 的详细分析见 GLM-5.1 开源权重深度解读。开源权重模型横向对比见 2026 年 8 月最佳开源 LLM(Agent 向)。
FAQ
GLM-5.3 是新架构吗?
不是。基座和 GLM-5.2 完全相同。所有提升来自后训练 RL Scaling。
API 什么时候能用?
智谱说”很快”——预计天级别。ZCode 和 AutoClaw 已经上线了。
权重什么时候开放?
从 8 月 14 日算起两周内,约 8 月 28 日。需要先完成安全加固。
打得过 Claude Fable 5 吗?
在 Z.ai Code Bench 上 GLM-5.3(31.4%)超过了 Opus 4.8(29.5%),而且 token 用量少 60%。但在公开基准上还没有和 Fable 5 直接对比过。整体编程能力接近 Claude Fable 5,体感超过其他国产模型——这是智谱自己的说法。
能用来做攻击性安全工作吗?
安全系统限制了攻击性能力。防御性使用(代码审查、漏洞扫描、补丁开发)完全支持。攻击性能力需要通过智谱的”网络安全受信访问”验证。


