Qwen 3.8 Max:阿里巴巴 2.4T 多模态旗舰模型全面解析
Qwen 3.8 Max 是阿里巴巴 2.4 万亿参数多模态旗舰模型,支持 1M 上下文、MoE 架构,Arena.AI 排名第二。本文详解规格、定价及 SandBase 接入方式。
摘要 — 2.4 万亿参数(95B 激活),多模态(文本+图像+视频+文档),1M 上下文,Arena.AI 排名第二。下周开源权重。定价约 $2.0/$6.0 每百万 token。SandBase 即将接入。
今天本来不打算写这篇
计划是写完 Qwen 3.7 的文章(已经写了,在这里)就收工。然后阿里今早发了 Qwen 3.8 Max。
不是预告。不是”即将推出”的博客。模型现在就在 chat.qwen.ai 上可用,API 通过 DashScope 已经开放。让我停下来的是——它直接冲到了 Arena.AI 文本排行榜第二。在 Opus 4.8 上面。在 GPT-5.5 上面。只有 Fable 5 更高。
跟三个月前 3.7 的发布相比,两件事不一样。第一:多模态。Qwen 3.7 Max 是纯文本——跑编码 Agent 没问题,但工作流里有截图或文档就得额外挂视觉模型。3.8 原生处理文本、图像、视频和文档。第二:阿里说下周开源权重。如果兑现,这将是有史以来最大的开放模型——2.4 万亿参数——也是阿里第一次开源 Max 级模型。
坦白讲,我还没来得及压力测试。Benchmark 数据不完整(下面会说)。但 Arena 排名是众包盲评的,比厂商自己报的分数难以质疑。这篇文章记录今天能确认的事实,同时标出缺失的部分。
架构与规格
Qwen 3.8 Max 采用 MoE(Mixture-of-Experts)架构。每个 token 经由路由机制从 2.4 万亿总参数池中激活 950 亿参数进行推理。这意味着它在推理时拥有约 95B 模型的计算密度,同时在训练阶段受益于完整参数集的更广知识容量。
| 维度 | Qwen 3.8 Max | Qwen 3.7 Max | 变化 |
|---|---|---|---|
| 总参数 | 2.4T(MoE) | 未公开 | 全新架构 |
| 激活参数 | 95B | 未公开 | — |
| 架构 | Mixture-of-Experts | Dense(推测) | 转向 MoE |
| 上下文窗口 | 1,000,000 token | 1,000,000 token | 不变 |
| 最大输出 | 65,536 token | 65,536 token | 不变 |
| 多模态输入 | 文本、图像、视频、文档 | 仅文本 | 新增 |
| 扩展思考 | 支持 | 支持 | 不变 |
| 函数调用 | 支持 | 支持 | 不变 |
| 结构化输出 | 支持 | 支持 | 不变 |
| 开源权重 | 下周(已宣布) | 无 | 首个 Max 开源 |
| 执行模式 | 同步 + 流式 | 同步 + 流式 | 不变 |
Max 级别从纯文本到全模态的跨越是最大的变化。此前,如果你同时需要阿里巴巴最强推理能力和视觉能力,必须在 Qwen 3.7 Max(文本)和 Qwen 3.7 Plus(多模态)之间分流。这意味着 Agent 管线被拆分到两个不同模型上,各有不同能力和定价。Qwen 3.8 Max 彻底消除了这种拆分。
Arena 排名与 Benchmark 现状
先说一个重要事实:截至发布当天,阿里巴巴尚未公布 Qwen 3.8 Max 的完整独立 benchmark 成绩单。目前没有可引用的 SWE-Pro、Terminal-Bench 或 GPQA Diamond 数据。
目前唯一可用的独立验证来自 Arena.AI。这是一个众包盲评排行榜,用户在不知道模型身份的情况下对比输出结果。在 Arena.AI 文本类别中,Qwen 3.8 Max 的表现:
- 所有模型中排名第 2(仅次于 Anthropic Fable 5)
- 中国实验室模型中排名第 1(领先 Kimi K3、DeepSeek V4 Pro)
- 超越 Claude Opus 4.8 和 GPT-5.5(按 Arena Elo 分数)
这是有意义的独立验证。Arena.AI 的方法论受到广泛认可,因为它衡量的是真实用户偏好,而非 benchmark 刷分。不过,一旦阿里巴巴或第三方评估机构公布结构化 benchmark 结果,我们会更新本文。
竞争格局(Arena.AI 文本类别,2026 年 8 月)
| 排名 | 模型 | 实验室 | 备注 |
|---|---|---|---|
| #1 | Fable 5 | Anthropic | 综合最强;定价最高 |
| #2 | Qwen 3.8 Max | 阿里巴巴 | 今日发布 |
| #3 | GPT-5.5 | OpenAI | Terminal-Bench 第一 |
| #4 | Kimi K3 | Moonshot AI | $3/$15 每百万 token |
| #5 | Claude Opus 4.8 | Anthropic | SWE-bench Pro 69.2% |
关键定位:Qwen 3.8 Max 处于最昂贵的西方前沿模型(Fable 5、Opus 4.8)和中国竞品(Kimi K3)之间,价格远低于它在 Arena 上超越的那些模型。
定价对比
| 模型 | 输入(每百万 token) | 输出(每百万 token) | 缓存读取 | 多模态 |
|---|---|---|---|---|
| Qwen 3.8 Max | $2.00 | $6.00 | $0.25/M(隐式) | ✅ 文本、图像、视频、文档 |
| Qwen 3.7 Max | $1.25 | $3.75 | $0.25/M | ❌ 仅文本 |
| Claude Opus 4.8 | $15.00 | $75.00 | $1.50/M | ✅ |
| Kimi K3 | $3.00 | $15.00 | 未公开 | ✅ |
| GPT-5.5 | $5.00 | $15.00 | $2.50/M | ✅ |
| Fable 5 | $20.00 | $100.00 | $2.00/M | ✅ |
性价比一目了然:Qwen 3.8 Max 以 Arena 第二的质量,输出成本仅为 Fable 5 的 10%、Opus 4.8 的 8%。与最接近的中国竞品 Kimi K3 相比,输入更便宜($2 vs $3),输出更便宜($6 vs $15),排名还更高。
与前代 Qwen 3.7 Max 对比:输入成本增加 60%($2.0 vs $1.25),输出成本增加 60%($6.0 vs $3.75),但换来的是多模态能力、2.4T MoE 架构和 Arena 排名的显著提升。对于之前需要在 3.7 Max(文本)和 3.7 Plus(视觉)之间分流的工作负载,整合到 3.8 Max 反而可能降低总成本——管线复杂度的减少本身就是节省。
隐式缓存
Qwen 3.8 Max 的隐式缓存定价为 $0.25 每百万 token。系统自动缓存重复前缀,无需手动设置 cache-control 头。对于上下文逐步增长的长周期 Agent 会话,效果如下:
- 第一轮:完整 $2.00/M 输入成本
- 后续轮次:仅新增 token 按 $2.00/M 计费,重复前缀降至 $0.25/M
- 500K token 上下文若 80% 命中缓存,每轮成本约 $0.30,而非 $1.00
核心能力
长时自主编程
与前代一致,Qwen 3.8 Max 擅长持续性编程 Agent 工作:多文件重构、全仓库 bug 排查、架构迁移——这些可能需要数小时持续运行的任务。1M 上下文窗口意味着它可以将整个中型代码仓库保持在内存中,同时跨文件执行连续修改。
多模态 Agent 工作流
原生图像、视频和文档理解能力解锁了此前需要模型切换才能实现的 Agent 模式:
- 截图驱动的 UI 测试:Agent 看到渲染后的页面,识别视觉回归,编写修复代码
- 文档提取管线:PDF、发票、扫描件端到端处理,无需 OCR 预处理
- 视频分析用于 QA:解析短录屏,验证 UI 交互流程
- 图表理解:直接解读架构图或数据可视化
复杂办公任务执行
Qwen 3.8 Max 定位于端到端办公自动化。例如:“读取这份合同 PDF,提取关键条款,生成对比表格,然后将摘要通过邮件发送”——作为单次 Agent 调用,多模态输入加工具调用输出,一步完成。
在 SandBase 上使用 Qwen 3.8 Max(即将上线)
Qwen 3.8 Max 将通过 SandBase 的标准 OpenAI 兼容接口提供服务。定价预计与阿里巴巴官方费率一致。以下是上线后的使用示例:
from openai import OpenAI
client = OpenAI(
base_url="https://api.sandbase.ai/v1",
api_key="your-sandbase-key"
)
# 纯文本推理任务
response = client.chat.completions.create(
model="alibaba/qwen3.8-max",
messages=[
{"role": "system", "content": "你是一位资深工程师。分析完整代码库,定位根因,提出最小修复方案。"},
{"role": "user", "content": "用户反馈上次部署后 /api/projects 端点间歇性返回 403。以下是完整代码库:..."}
],
tools=[{
"type": "function",
"function": {
"name": "edit_file",
"description": "编辑指定路径的文件",
"parameters": {
"type": "object",
"properties": {
"path": {"type": "string"},
"content": {"type": "string"}
},
"required": ["path", "content"]
}
}
}],
max_tokens=16384,
stream=True
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
多模态输入示例
# 处理包含视觉元素的文档
response = client.chat.completions.create(
model="alibaba/qwen3.8-max",
messages=[
{"role": "user", "content": [
{"type": "text", "text": "提取这个 PDF 页面中的所有表格,返回结构化 JSON,包含列名和行数据。"},
{"type": "image_url", "image_url": {"url": "https://example.com/contract-page-3.png"}}
]}
],
max_tokens=8192
)
print(response.choices[0].message.content)
视频输入用于 Agent QA
# 分析录屏,找出 UI 问题
response = client.chat.completions.create(
model="alibaba/qwen3.8-max",
messages=[
{"role": "user", "content": [
{"type": "text", "text": "观看这段用户完成结账流程的录屏。识别任何 UX 问题、交互故障或视觉缺陷,每个问题附带时间戳。"},
{"type": "video_url", "video_url": {"url": "https://example.com/checkout-recording.mp4"}}
]}
],
max_tokens=4096
)
注意: SandBase 对 Qwen 3.8 Max 的支持即将上线。以上代码示例基于阿里巴巴公布的 API 规格。模型在平台正式上线后,我们会更新本节内容。
开源发布(下周)
阿里巴巴已宣布 Qwen 3.8 Max 权重将于下周开源。这将是 Qwen 系列中首个开放发布的 Max 级别模型。此前的 Max 模型(3.5 Max、3.6 Max、3.7 Max)均为 API-only。
这一决定意义重大:
- 大规模自托管:拥有基础设施的组织(2.4T 模型可能需要多节点 GPU 集群)可在本地运行,确保数据主权
- 微调潜力:开放权重使 API-only 无法实现的领域特定适配成为可能
- 社区研究:2.4T 参数的 MoE 架构将成为可供研究的最大开放模型
- 竞争压力:这将推动其他实验室在前沿级别走向开放
权重发布后,我们会发布专门的自托管指南和量化版本说明。
何时选择 Qwen 3.8 Max
适合选择 Qwen 3.8 Max 的场景:
- 需要顶级推理能力和多模态输入统一在同一模型中——不再需要文本和视觉变体之间分流
- Agent 工作流需要处理文档、截图或视频,同时处理代码和文本
- 追求 Arena 第二的性能,但成本仅为 Fable 5 或 Opus 4.8 的零头
- 长周期自主 Agent 是主要场景,需要 1M 上下文配合激进缓存策略
- 正在构建端到端办公自动化 Agent,处理多样化输入类型
不适合的场景:
- 仅需文本推理且成本敏感——Qwen 3.7 Max 的 $1.25/$3.75 仍然更便宜
- 需要经过验证的 benchmark 分数才能做决策(等待独立评估发布)
- 美国/欧盟数据驻留是硬性要求
- 不计成本追求绝对最强模型(Fable 5 仍然 Arena 第一)
- 需要立即可用的最强开源模型——权重下周到,不是现在
Qwen 3.8 Max vs. Qwen 3.7 Max:升级决策
| 因素 | Qwen 3.7 Max | Qwen 3.8 Max | 结论 |
|---|---|---|---|
| 输入价格 | $1.25/M | $2.00/M | 3.7 更便宜 |
| 输出价格 | $3.75/M | $6.00/M | 3.7 更便宜 |
| 多模态 | ❌ | ✅ | 3.8 胜出 |
| 架构 | Dense(较小) | 2.4T MoE(95B 激活) | 3.8 更大 |
| Arena 排名 | 较低 | 全场第 2 | 3.8 胜出 |
| 开源权重 | 无 | 下周 | 3.8 胜出 |
| Benchmark 数据 | 已公布(SWE-Pro 60.6) | 仅 Arena(暂时) | 3.7 更透明 |
升级建议:如果需要多模态输入、追求最强可用推理能力、或计划在权重发布后自托管。
留在 3.7 的理由:工作负载为纯文本、对成本敏感、且已公布的 benchmark 让你确信 3.7 满足质量要求。
常见问题
Qwen 3.8 Max 与 Claude Fable 5 相比如何?
Fable 5 占据 Arena 第一,被广泛认为是 2026 年 8 月最强模型。Qwen 3.8 Max 排名第二——有意义地接近,但在最困难的推理任务上尚未追平。关键差异在价格:Fable 5 的 $20/$100 每百万 token vs Qwen 3.8 Max 的 $2/$6。对于绝大多数 Agent 工作负载,质量差距不足以证明 10-17 倍的价格溢价是合理的。
目前有独立 benchmark 成绩吗?
尚无完整数据。截至发布日(2026 年 8 月 3 日),主要独立验证来自 Arena.AI 的众包排名,Qwen 3.8 Max 在文本类别中排名全场第二。预计阿里巴巴和第三方评估机构将在未来数日公布结构化 benchmark 结果(SWE-Pro、Terminal-Bench、GPQA 等)。届时我们将更新本文。
Qwen 3.8 Max 何时可在 SandBase 上使用?
SandBase 正在完成 Qwen 3.8 Max 的集成工作。预计在官方发布后数日内上线。模型将以 alibaba/qwen3.8-max 通过标准 OpenAI 兼容接口提供,定价与阿里巴巴官方费率一致。
可以自托管 Qwen 3.8 Max 吗?
目前还不行,但下周可以。阿里巴巴已承诺开源权重——这将是首个可自托管的 Max 级别 Qwen 模型。考虑到 2.4T 总参数量,预计需要强大的基础设施(高显存 GPU 多节点集群)。社区量化版本预计会在权重发布后数日内出现。
它支持哪些输入模态?
Qwen 3.8 Max 原生接受文本、图像、视频和文档(PDF 渲染为图像)输入。输出仍为纯文本(包括结构化 JSON、代码和函数调用)。这使其适合需要”看”和”读”多样化输入,同时产出可执行文本或代码的 Agent 工作流。


