openPangu-2.0-Pro:华为505B开源模型

华为发布 openPangu-2.0-Pro——505B 参数 MoE 开源大模型,全程使用昇腾 910B NPU 训练。架构解析、算力主权意义、以及对性能声明的客观评估。

TL;DR — 2026年8月4日,华为开源 openPangu-2.0-Pro:505B 参数 MoE 大模型,全程在昇腾 910B NPU 上完成预训练——没有用到一块 Nvidia GPU。这是首个突破 500B 参数规模的昇腾原生开放权重模型。权重、推理代码和技术报告已在 GitCode 发布。性能声明暂未经第三方验证。以下是我们掌握的事实、值得关注的亮点、以及需要等待确认的部分。

训练硬件第一次让我在意

说实话,评估开源模型时,我通常不关心它是用什么硬件训练的。质量、速度、成本、许可证——这些才是工程决策的核心。模型跑在 A100 还是 H100 上训练,那是训练团队的事。

openPangu-2.0-Pro 改变了这个想法。当一个 505B 模型明确声明预训练阶段完全没有使用 Nvidia GPU,并且附带了昇腾专用算子代码和详细描述昇腾 910B 集群部署的技术报告时——硬件本身就成了故事的核心。这不是一个模型发布,而是一个完整算力生态的能力证明。

这个证明对你是否重要,取决于你是只关心推理侧(那就继续看架构和社区适配进展),还是也在关注 AI 算力供应链的走向。

模型规格一览

属性
模型名称openPangu-2.0-Pro
总参数量505B(5050亿)
架构Mixture-of-Experts (MoE)
每 token 激活参数~18B
上下文窗口512,000 tokens
训练数据量~34万亿 tokens
训练硬件昇腾 910B NPU(全程)
优化器Muon
注意力机制Multi-head Latent Attention (MLA)、Decoupled Sparse Attention、Sliding Window Attention
后训练三阶段流水线 + Online Policy Distillation (OPD)
许可开放权重(具体条款见仓库)
获取方式GitCode 昇腾社区、华为云 ModelArts Studio
已发布产物权重、推理代码、技术报告

架构剖析

MoE:505B 总量,18B 激活

openPangu-2.0-Pro 采用当下主流的 MoE 路线:用巨大的总参数量换取知识容量,同时将单个 token 的计算开销控制在可接受范围内。505B 总参数、每 token 仅激活 ~18B——前向计算量大致等同于一个 18–20B 的稠密模型,但你仍然需要足够的显存来装载(或分片)完整的 505B 权重。

这个激活比例相当激进。作为对比,DeepSeek V4 同样走 MoE 路线但专家数量和路由策略不同;Llama 4 Maverick(400B 总参数,~17B 激活)处于相近的量级。openPangu-2.0-Pro 在总参数量上超越了二者,同时将激活切片保持精简。

注意力栈:三种机制协同工作

注意力设计是技术报告中最有料的部分。华为堆叠了三种互补机制:

  1. Multi-head Latent Attention (MLA) — 将 KV cache 压缩到低维潜空间。对 512K 上下文窗口至关重要:原生 KV cache 在 512K 长度下会占用天量显存,MLA 以微小的注意力精度损失换来显存占用量的大幅降低。

  2. Decoupled Sparse Attention — 不同注意力头关注上下文的不同子集,避免每个头都对整个 512K 窗口做 O(n²) 全注意力计算。

  3. Sliding Window Attention — 部分层使用局部滑窗捕获细粒度局部模式,与其他层的稀疏全局注意力互补。

这个组合在架构思路上与 DeepSeek V4 的注意力设计类似——行业正在向混合局部/稀疏/潜变量方案收敛。

Muon 优化器

技术报告确认训练使用了 Muon 优化器而非 AdamW。Muon 在更新方向上使用动量而非逐元素缩放,大规模训练时能获得更好的 loss 曲线。在这个规模上使用 Muon 仍属少见,华为团队在昇腾栈上验证了其有效性值得关注。

算力主权:为什么硬件这次成了主角

整个预训练——505B 参数、34万亿 tokens——全部跑在昇腾 910B NPU 上。零 Nvidia、零 AMD。这是首次有超过 500B 参数的开放权重模型做到这一点。

这证明了什么

昇腾 910B 集群能够支撑超大规模预训练的连续稳定运行:数千小时的分布式训练、万亿级 token 吞吐。这不是微调实验,不是 demo,而是前沿规模的完整预训练。

尚未证明的部分

  • 训练效率对比:技术报告没有给出与等规模 H100/H200 训练的直接 MFU 对比。不知道是否花了更多时间、更多硬件。
  • 质量对齐:在缺乏独立 benchmark 的情况下,无法确认模型质量是否与同等规模的 Nvidia 训练模型持平。
  • 更大规模的可扩展性:505B 很大,但前沿实验室在做万亿参数级训练。昇腾能否继续扩展有待观察。

供应链纵深

值得注意的是芯片层面的供应链故事。此前昇腾芯片据报道使用台积电 7nm 制程 + Samsung HBM。未来迭代预计将转向中芯国际制造 + 长鑫存储——形成完整的国产供应链。openPangu-2.0-Pro 代表当前能力水平;下一代将检验全国产制造链能否维持这一性能。

横向对比:openPangu-2.0-Pro vs DeepSeek V4 vs Llama 4 Maverick

openPangu-2.0-ProDeepSeek V4Llama 4 Maverick
总参数505B685B400B
激活参数~18B~37B~17B
上下文窗口512K1M1M
训练硬件昇腾 910BNvidia (H800)Nvidia (H100)
训练数据量~34T tokens~30T tokens~22T tokens
许可证开放权重MITLlama license
MoE
推理生态昇腾原生;社区 Nvidia 适配中Nvidia、AMD、CPU 广泛支持Nvidia 为主,生态完善
独立 benchmark❌ 待验证✅ 社区广泛测试✅ 社区广泛测试

最诚实的结论:纸面数据上 openPangu-2.0-Pro 有竞争力。但在社区完成权重转换并在标准评测集上跑出成绩之前,无法确认质量是否对齐。512K 上下文窗口短于 DeepSeek V4 和 Llama 4 的 1M,但对绝大多数 Agent 场景已经够用。

更多开源模型的 Agent 适用性对比,参见我们的开源大模型 Agent 指南

后训练:三阶段 + Online Policy Distillation

后训练流程分为三个阶段,以 Online Policy Distillation(OPD)收尾:

  1. 监督微调(SFT) — 在精选数据集上进行标准指令微调。
  2. 基于人类反馈的强化学习(RLHF) — 偏好优化,对齐人类判断。
  3. 在线策略蒸馏(OPD) — 更大或更强的教师模型在最终对齐阶段实时提供训练信号,使学生模型突破静态偏好数据的上限。

OPD 是亮点。不是一次性蒸馏然后冻结,而是在训练过程中持续从活跃的教师模型学习。这能弥补静态 SFT/RLHF 管线在复杂推理和多步任务上的不足——这些恰恰是 reward model 校准困难的地方。

如何运行 openPangu-2.0-Pro

昇腾硬件(官方支持)

模型通过以下渠道获取:

  • GitCode 昇腾社区 — 权重和推理代码
  • 华为云 ModelArts Studio — 托管推理服务

如果你已在华为云生态中,或有昇腾硬件,现在就能跑。

Nvidia GPU(社区适配中)

社区正在进行权重转换和推理代码适配,目标是让模型能在标准 Nvidia GPU 上通过 vLLM 或 SGLang 运行。主要工作包括:

  • 将昇腾专用张量格式转为 PyTorch 原生格式
  • 用 CUDA 重新实现自定义算子
  • 验证转换前后数值一致性

截至本文发布(2026年8月7日),社区尚未发布完整的 Nvidia 兼容 checkpoint。请关注 GitCode 仓库的更新。

显存需求

505B 参数 FP16 下大约需要 1TB 显存。实际使用 INT8 量化约 500GB,INT4 约 250GB。即便量化后也需要多机或高端多卡配置(INT4 最低 8×H100 80GB,长上下文推理建议 16 卡以上)。

对 Agent 开发者的实际建议

如果你在用开源模型构建 Agent,以下是务实评估:

观望为主。 openPangu-2.0-Pro 架构有亮点,硬件故事有意义。但在以下条件满足之前:

  1. 社区完成到 Nvidia 硬件的可用移植
  2. 独立 benchmark 确认性能声明
  3. 推理工具链成熟到超出昇腾生态

——对多数 Agent 部署来说暂不实用。18B 的激活参数量暗示推理可能又快又便宜,如果生态跟上的话。

如果你在国内昇腾生态中,这立刻有用。它是你的硬件栈上能原生跑的最大开源模型,附带官方昇腾推理优化。

如果你关心供应链多元化,这是一个里程碑。模型证明了纯昇腾大规模训练能产出可用的大语言模型。随着生态成熟,这可能打破 AI 训练和推理领域当前的 Nvidia 单一格局。

局限性和未知项

直说几点我们不知道的:

  • Benchmark 数据为自报。 技术报告包含标准评测集的成绩,但无第三方复现。历史经验告诉我们,等独立验证。
  • 许可条款需仔细阅读。 “开放权重”不等于”MIT”。商用、修改、再分发的具体条款请查看仓库。
  • 长上下文质量未经确认。 有 512K 窗口不等于全程检索质量好。需要独立的 needle-in-haystack 和长上下文评测。
  • 推理生态不成熟。 昇腾和华为云之外,今天要跑这个模型需要尚不存在的社区工具。

常见问题

openPangu-2.0-Pro 是真正的开源吗?

权重、推理代码和技术报告已公开——按当前标准属于”开放权重”。训练代码、数据配比、中间 checkpoint 是否发布未确认。具体条款以 GitCode 仓库为准。

现在能在 Nvidia GPU 上跑吗?

官方暂不支持。社区转换工作进行中,预计数周内出初版,但质量验证需要更长时间。

18B 激活参数对推理速度意味着什么?

理论上推理速度应该接近一个 18B 稠密模型(加上路由开销)。MoE 架构意味着每个 token 只使用 505B 中的一小部分。实际速度取决于推理框架对路由和专家选择的实现效率。

比 DeepSeek V4 更适合做 Agent 吗?

目前真的不知道。DeepSeek V4 已经被社区广泛测试,在工具调用、长上下文、多步推理方面表现扎实。openPangu-2.0-Pro 的声明暗示有竞争力,但声明不等于 benchmark。成熟的选择请参考我们的 DeepSeek V4 解析

训练硬件对我作为用户有什么意义?

如果你只做推理,意义有限——等社区适配完成就行。但对行业而言:如果昇腾能支持前沿规模训练,就创造了第二个可行的算力生态。无论你用什么硬件,竞争、定价和供应链韧性都会受益。

上下文窗口和竞品比怎么样?

512K tokens。短于 DeepSeek V4 和 Llama 4 的 1M,但长于 2024–2025 年多数模型。对典型 Agent 任务来说 512K 绰绰有余——多数 Agent 循环实际使用的上下文很少超过 100K tokens。


最后更新:2026年8月7日。独立 benchmark 和社区 Nvidia 适配发布后,本文将持续更新。