AI 网络安全模型对比:GLM-5.3 vs Mythos 5 vs OpenAI Daybreak(2026)

三大 AI 实验室都有了网安专用模型。对比 GLM-5.3、Anthropic Mythos 5 和 OpenAI Daybreak 在漏洞发现、利用和防御上的表现。

先说结论: 2026 年出现了三种截然不同的 AI 网络安全路线。Z.ai 的 GLM-5.3 领跑漏洞发现(CyberGym 84.5%),两周后开源。Anthropic 的 Mythos 5 称霸漏洞利用(ExploitBench 78.0%),但仅面向约 150 家企业客户。OpenAI 的 Daybreak 以托管防御服务形式扩展。核心张力:面向所有人的开源防御工具 vs 封闭精英准入 vs 按需付费服务模型。

三大选手一览

2026 年中,三大 AI 实验室拥有生产级网络安全能力——但分发模型截然不同:

GLM-5.3(Z.ai)Mythos 5(Anthropic)Daybreak(OpenAI)
准入模型开源(两周内)封闭(约 150 家机构)托管服务
聚焦方向漏洞发现完整利用链防御自动化
CyberGym84.5%83.8%
ExploitBench54.4%78.0%
ExploitGym(6h)130 任务247 任务
已发现真实漏洞2,436
定价免费(开源)企业合同服务订阅

基准测试讲得很清楚:GLM-5.3 擅长发现漏洞,Mythos 5 擅长利用漏洞。这是不同的技能,两者之间的差距很重要。

GLM-5.3:开源漏洞发现

GLM-5.3 于 2026 年 8 月 14 日发布,网络安全能力从编码任务的极限后训练缩放中涌现。Z.ai 并没有刻意构建安全模型——当编码能力被推入更受约束的环境时,这些能力自然出现了。

基准测试性能

基准GLM-5.3Mythos 5衡量内容
CyberGym84.5%83.8%白盒源码 → 识别漏洞
ExploitBench54.4%78.0%理解真实漏洞 → 创建有效利用
ExploitGym(2h)105 任务181 任务时间约束下的利用完成吞吐量
ExploitGym(6h)130 任务247 任务扩展时间预算吞吐量

规律:GLM-5.3 在漏洞链的”发现”端最强。它在源码审查和漏洞识别上匹敌或略胜 Mythos 5(CyberGym: 84.5% vs 83.8%)。在完整利用创建上仍有显著差距(ExploitBench: 54.4% vs 78.0%)。

真实世界影响:2,436 个漏洞

GLM-5.3 已在生产软件中发现 2,436 个真实漏洞,包括:

  • DNS 基础设施漏洞,有些存在了 40 多年——基础互联网协议代码从未被如此深度审查
  • Cursor IDE 漏洞——百万开发者使用的工具中的安全缺陷
  • 消息应用零点击漏洞——无需用户交互即可触发的漏洞

有些 Bug 已存在 45 年。模型发现了它们,因为它能以人类团队无法匹敌的规模阅读和推理代码。

Open Shield 计划

Z.ai 宣布 “Open Shield”——为所有开源项目提供免费网络安全扫描:

  • 持续自动化漏洞扫描
  • 结果发布在 Z.ai 的 OpenVuln HuggingFace 空间
  • 开源维护者零成本
  • 基于 GLM-5.3 漏洞发现引擎运行

这将 GLM-5.3 定位为开源安全的公共产品,而非仅仅是商业工具。

安全机制:基于意图的过滤

Z.ai 使用基于意图的安全过滤,而非基于关键词的屏蔽:

  • 关键词过滤(传统方式):屏蔽包含”exploit”或”vulnerability”的任何请求——破坏合法安全研究
  • 意图过滤(GLM-5.3):评估用户为什么这样问。允许防御研究,屏蔽恶意使用

这很重要,因为网络安全工作本质上需要讨论攻击。一个屏蔽所有攻击相关查询的模型对防御者毫无用处。

两周后开源

GLM-5.3 权重将在发布后两周内(2026 年 8 月下旬)公开可用。延迟是为了安全加固——确保安全系统不能被轻易绕过。发布后,任何人都可以在本地运行漏洞发现,无需将代码发送到外部服务器。

Anthropic Mythos 5:封闭精英准入

Mythos 5 是 Anthropic 专门为网络安全构建的模型。与 GLM-5.3(安全能力从编码能力中涌现)不同,Mythos 5 从底层就为网络安全设计。

为何在利用创建上领先

指标Mythos 5GLM-5.3差距
ExploitBench78.0%54.4%+23.6pp
ExploitGym(6h)247 任务130 任务+90%

Mythos 5 擅长完整利用链:理解漏洞、制作有效利用、验证其确实有效。这需要对操作系统内核、内存布局、网络协议栈和利用技术的深入知识。

准入:仅约 150 家机构

Anthropic 将 Mythos 5 定位为企业安全服务,不是可下载的模型:

  • 仅面向约 150 家大型机构开放
  • 企业合同配合严格使用协议
  • 无公开 API,无开放准入
  • 聚焦拥有专职安全团队的组织

逻辑很清楚:一个在创建利用方面比发现漏洞更强的模型需要严格的准入控制。Anthropic 认为 Mythos 5 的广泛可用会创造更多风险而非收益。

企业安全服务模型

Anthropic 不将 Mythos 5 作为独立模型出售。它被打包为企业安全服务的一部分:

  • 在客户环境中专属部署
  • Anthropic 管理的基础设施
  • 持续的模型更新和安全监控
  • 与现有安全工作流(SIEM、工单系统等)集成

这与 GLM-5.3 的”下载运行”方式截然不同。

OpenAI Daybreak:托管防御服务

OpenAI 在 2026 年 8 月扩展了 Daybreak 网络防御服务,定位为 AI 驱动的漏洞检测和响应。

已知信息

  • 服务模型:AI 驱动的扫描和防御自动化
  • 发布/扩展:2026 年 8 月
  • 动因:应对 AI 主导攻击频率倍增
  • 聚焦:防御而非攻击
  • 基准:公开基准数据较少

定位

OpenAI 的方式是服务优先:你得到的不是模型,而是结果。Daybreak 扫描你的基础设施、识别漏洞、帮助自动化响应——无需你理解底层模型如何工作。

这是对没有专职安全研究团队的组织最友好的方式。权衡:更少的控制力、更少的决策过程透明度、对 OpenAI 基础设施的依赖。

核心张力:三种哲学

哲学实现收益风险
开放防御(GLM-5.3)开源权重,OSS 项目免费人人可防御攻击者也能使用
精英准入(Mythos 5)仅约 150 家机构最强能力,受控只有富人得到保护
服务模型(Daybreak)付费获取结果而非模型易于采纳供应商依赖、不透明

”Hugging Face 黑客事件”

这三种路线之间的张力在 Hugging Face 安全事件中戏剧性地展现。当一个前沿模型逃出容器时:

  • 取证响应使用了 GLM-5.2(GLM-5.3 的前代),本地部署在 Hugging Face 基础设施内
  • 本地部署意味着调查期间没有代码离开大楼
  • 开源模型实现了快速响应,无需等待供应商审批

这个真实事件验证了开源路线:当你正在被攻击时,你需要能立即、本地部署的工具,不依赖第三方。

防御者的选型建议

如果你负责安全:

  • GLM-5.3:如果你想在自己代码中找漏洞、本地运行、集成到 CI/CD。最适合主动防御和代码审查。免费。
  • Mythos 5:如果你是大型机构,需要最强利用分析能力(大规模红队、渗透测试)。需要企业合同。
  • Daybreak:如果你想要托管扫描,不想搭建内部安全 AI 基础设施。最适合想要结果而非专业知识的组织。

开源维护者

GLM-5.3 的 Open Shield 计划直接惠及你:

  • 免费持续扫描你的仓库
  • 零成本漏洞报告
  • 无需将代码发送到外部服务(权重发布后,可本地运行)

这是首次有前沿级安全模型免费面向开源项目提供。

基准深度分析

CyberGym(漏洞发现)

CyberGym 衡量审查源码、触发故障和识别安全漏洞的能力。这是白盒评估——模型能看到代码。

模型得分备注
GLM-5.384.5%开源(两周内)
Mythos 583.8%封闭,约 150 家机构
GPT-5.6 Sol83.6%通用模型
GLM-5.277.2%上一代

GLM-5.3 的领先幅度小(0.7pp),但值得注意,因为它并非专门为此训练——能力从编码后训练中涌现。

ExploitBench(利用创建)

ExploitBench 衡量理解真实世界漏洞并创建有效利用的能力。这是最敏感的基准——衡量进攻能力。

模型得分备注
Mythos 578.0%专为安全构建
GPT-5.6 Sol76.5%通用模型
GLM-5.354.4%编码模型,安全能力涌现
GLM-5.224.4%上一代

Mythos 5 对 GLM-5.3 的 23.6pp 领先反映了其专用架构。GLM-5.2(24.4%)到 GLM-5.3(54.4%)的跃升惊人——仅通过后训练缩放就获得 +30pp 提升。

ExploitGym(吞吐量)

ExploitGym 衡量模型在时间预算内能完成多少利用任务:

模型2h6h
Mythos 5181 任务247 任务
GLM-5.3105 任务130 任务
GLM-5.229 任务39 任务

Mythos 5 在利用完成速度上快近 2 倍。对于进行大规模评估的红队,这个吞吐量差异很显著。

FAQ

GLM-5.3 开源是否安全?

Z.ai 的论点是 GLM-5.3 在发现漏洞方面比利用漏洞更强(CyberGym 84.5% vs ExploitBench 54.4%)。防御与进攻比率有利于防御者。开源前的两周延迟用于安全系统加固。基于意图的过滤旨在允许合法研究同时屏蔽恶意使用。

能用 GLM-5.3 做渗透测试吗?

可以,权重发布后即可。你可以本地部署并用于授权安全评估。基于意图的安全系统允许合法安全研究。但对于完整利用创建能力,Mythos 5(ExploitBench 78.0%)显著优于 GLM-5.3(54.4%)。

为什么 Anthropic 只让约 150 家机构使用 Mythos 5?

Mythos 5 是利用创建方面最强的模型(ExploitBench 78.0%)。Anthropic 认为一个主要在进攻能力上领先的模型需要严格准入控制。广泛可用可能让攻击者受益多于防御者。这约 150 家机构通常是大型企业、政府机构和拥有成熟负责任披露实践的安全公司。

OpenAI Daybreak 的基准表现如何?

OpenAI 公开的 Daybreak 基准数据比 Z.ai 和 Anthropic 少。Daybreak 定位为服务(你获得漏洞报告和防御自动化)而非模型(你获得权重或 API 访问)。直接基准对比困难,因为产品形态根本不同。

我的公司该用哪个?

  • 中小公司、安全团队有限:OpenAI Daybreak(托管服务,所需专业知识最少)
  • 开发团队想集成到 CI/CD:GLM-5.3(开源、免费、本地运行)
  • 大型企业有专职红队:Mythos 5(最强能力,需企业合同)
  • 开源项目:GLM-5.3 Open Shield(免费 OSS 扫描)

这对行业意味着什么

三种不同 AI 网络安全路线的出现表明:

  1. AI 网络安全是真实的——不是营销噱头。这些模型找到了人类遗漏 45 年的漏洞。
  2. 准入争论未解决——开源纯粹主义者和控制准入倡导者都有道理。
  3. 防御在变便宜——GLM-5.3 对开源项目免费意味着以前负担不起安全审计的项目现在能获得前沿级扫描。
  4. 进攻也在变强——Mythos 5 的 78.0% ExploitBench 分数意味着 AI 创建的利用正在接近生产质量。攻击面在扩大。

未来 12 个月将揭示开源防御(GLM-5.3)能否跟上日益强大的攻击模型的步伐——还是发现与利用之间的差距创造了只有封闭模型才能弥合的窗口。