Qwen 3.8 Max:阿里巴巴 2.4T 多模态旗舰模型全面解析

Qwen 3.8 Max 是阿里巴巴 2.4 万亿参数多模态旗舰模型,支持 1M 上下文、MoE 架构,Arena.AI 排名第二。本文详解规格、定价及 SandBase 接入方式。

摘要 — 2.4 万亿参数(95B 激活),多模态(文本+图像+视频+文档),1M 上下文,Arena.AI 排名第二。下周开源权重。定价约 $2.0/$6.0 每百万 token。SandBase 即将接入。

今天本来不打算写这篇

计划是写完 Qwen 3.7 的文章(已经写了,在这里)就收工。然后阿里今早发了 Qwen 3.8 Max。

不是预告。不是”即将推出”的博客。模型现在就在 chat.qwen.ai 上可用,API 通过 DashScope 已经开放。让我停下来的是——它直接冲到了 Arena.AI 文本排行榜第二。在 Opus 4.8 上面。在 GPT-5.5 上面。只有 Fable 5 更高。

跟三个月前 3.7 的发布相比,两件事不一样。第一:多模态。Qwen 3.7 Max 是纯文本——跑编码 Agent 没问题,但工作流里有截图或文档就得额外挂视觉模型。3.8 原生处理文本、图像、视频和文档。第二:阿里说下周开源权重。如果兑现,这将是有史以来最大的开放模型——2.4 万亿参数——也是阿里第一次开源 Max 级模型。

坦白讲,我还没来得及压力测试。Benchmark 数据不完整(下面会说)。但 Arena 排名是众包盲评的,比厂商自己报的分数难以质疑。这篇文章记录今天能确认的事实,同时标出缺失的部分。

架构与规格

Qwen 3.8 Max 采用 MoE(Mixture-of-Experts)架构。每个 token 经由路由机制从 2.4 万亿总参数池中激活 950 亿参数进行推理。这意味着它在推理时拥有约 95B 模型的计算密度,同时在训练阶段受益于完整参数集的更广知识容量。

维度Qwen 3.8 MaxQwen 3.7 Max变化
总参数2.4T(MoE)未公开全新架构
激活参数95B未公开
架构Mixture-of-ExpertsDense(推测)转向 MoE
上下文窗口1,000,000 token1,000,000 token不变
最大输出65,536 token65,536 token不变
多模态输入文本、图像、视频、文档仅文本新增
扩展思考支持支持不变
函数调用支持支持不变
结构化输出支持支持不变
开源权重下周(已宣布)首个 Max 开源
执行模式同步 + 流式同步 + 流式不变

Max 级别从纯文本到全模态的跨越是最大的变化。此前,如果你同时需要阿里巴巴最强推理能力和视觉能力,必须在 Qwen 3.7 Max(文本)和 Qwen 3.7 Plus(多模态)之间分流。这意味着 Agent 管线被拆分到两个不同模型上,各有不同能力和定价。Qwen 3.8 Max 彻底消除了这种拆分。

Arena 排名与 Benchmark 现状

先说一个重要事实:截至发布当天,阿里巴巴尚未公布 Qwen 3.8 Max 的完整独立 benchmark 成绩单。目前没有可引用的 SWE-Pro、Terminal-Bench 或 GPQA Diamond 数据。

目前唯一可用的独立验证来自 Arena.AI。这是一个众包盲评排行榜,用户在不知道模型身份的情况下对比输出结果。在 Arena.AI 文本类别中,Qwen 3.8 Max 的表现:

  • 所有模型中排名第 2(仅次于 Anthropic Fable 5)
  • 中国实验室模型中排名第 1(领先 Kimi K3、DeepSeek V4 Pro)
  • 超越 Claude Opus 4.8 和 GPT-5.5(按 Arena Elo 分数)

这是有意义的独立验证。Arena.AI 的方法论受到广泛认可,因为它衡量的是真实用户偏好,而非 benchmark 刷分。不过,一旦阿里巴巴或第三方评估机构公布结构化 benchmark 结果,我们会更新本文。

竞争格局(Arena.AI 文本类别,2026 年 8 月)

排名模型实验室备注
#1Fable 5Anthropic综合最强;定价最高
#2Qwen 3.8 Max阿里巴巴今日发布
#3GPT-5.5OpenAITerminal-Bench 第一
#4Kimi K3Moonshot AI$3/$15 每百万 token
#5Claude Opus 4.8AnthropicSWE-bench Pro 69.2%

关键定位:Qwen 3.8 Max 处于最昂贵的西方前沿模型(Fable 5、Opus 4.8)和中国竞品(Kimi K3)之间,价格远低于它在 Arena 上超越的那些模型。

定价对比

模型输入(每百万 token)输出(每百万 token)缓存读取多模态
Qwen 3.8 Max$2.00$6.00$0.25/M(隐式)✅ 文本、图像、视频、文档
Qwen 3.7 Max$1.25$3.75$0.25/M❌ 仅文本
Claude Opus 4.8$15.00$75.00$1.50/M
Kimi K3$3.00$15.00未公开
GPT-5.5$5.00$15.00$2.50/M
Fable 5$20.00$100.00$2.00/M

性价比一目了然:Qwen 3.8 Max 以 Arena 第二的质量,输出成本仅为 Fable 5 的 10%、Opus 4.8 的 8%。与最接近的中国竞品 Kimi K3 相比,输入更便宜($2 vs $3),输出更便宜($6 vs $15),排名还更高。

与前代 Qwen 3.7 Max 对比:输入成本增加 60%($2.0 vs $1.25),输出成本增加 60%($6.0 vs $3.75),但换来的是多模态能力、2.4T MoE 架构和 Arena 排名的显著提升。对于之前需要在 3.7 Max(文本)和 3.7 Plus(视觉)之间分流的工作负载,整合到 3.8 Max 反而可能降低总成本——管线复杂度的减少本身就是节省。

隐式缓存

Qwen 3.8 Max 的隐式缓存定价为 $0.25 每百万 token。系统自动缓存重复前缀,无需手动设置 cache-control 头。对于上下文逐步增长的长周期 Agent 会话,效果如下:

  • 第一轮:完整 $2.00/M 输入成本
  • 后续轮次:仅新增 token 按 $2.00/M 计费,重复前缀降至 $0.25/M
  • 500K token 上下文若 80% 命中缓存,每轮成本约 $0.30,而非 $1.00

核心能力

长时自主编程

与前代一致,Qwen 3.8 Max 擅长持续性编程 Agent 工作:多文件重构、全仓库 bug 排查、架构迁移——这些可能需要数小时持续运行的任务。1M 上下文窗口意味着它可以将整个中型代码仓库保持在内存中,同时跨文件执行连续修改。

多模态 Agent 工作流

原生图像、视频和文档理解能力解锁了此前需要模型切换才能实现的 Agent 模式:

  • 截图驱动的 UI 测试:Agent 看到渲染后的页面,识别视觉回归,编写修复代码
  • 文档提取管线:PDF、发票、扫描件端到端处理,无需 OCR 预处理
  • 视频分析用于 QA:解析短录屏,验证 UI 交互流程
  • 图表理解:直接解读架构图或数据可视化

复杂办公任务执行

Qwen 3.8 Max 定位于端到端办公自动化。例如:“读取这份合同 PDF,提取关键条款,生成对比表格,然后将摘要通过邮件发送”——作为单次 Agent 调用,多模态输入加工具调用输出,一步完成。

在 SandBase 上使用 Qwen 3.8 Max(即将上线)

Qwen 3.8 Max 将通过 SandBase 的标准 OpenAI 兼容接口提供服务。定价预计与阿里巴巴官方费率一致。以下是上线后的使用示例:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.sandbase.ai/v1",
    api_key="your-sandbase-key"
)

# 纯文本推理任务
response = client.chat.completions.create(
    model="alibaba/qwen3.8-max",
    messages=[
        {"role": "system", "content": "你是一位资深工程师。分析完整代码库,定位根因,提出最小修复方案。"},
        {"role": "user", "content": "用户反馈上次部署后 /api/projects 端点间歇性返回 403。以下是完整代码库:..."}
    ],
    tools=[{
        "type": "function",
        "function": {
            "name": "edit_file",
            "description": "编辑指定路径的文件",
            "parameters": {
                "type": "object",
                "properties": {
                    "path": {"type": "string"},
                    "content": {"type": "string"}
                },
                "required": ["path", "content"]
            }
        }
    }],
    max_tokens=16384,
    stream=True
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

多模态输入示例

# 处理包含视觉元素的文档
response = client.chat.completions.create(
    model="alibaba/qwen3.8-max",
    messages=[
        {"role": "user", "content": [
            {"type": "text", "text": "提取这个 PDF 页面中的所有表格,返回结构化 JSON,包含列名和行数据。"},
            {"type": "image_url", "image_url": {"url": "https://example.com/contract-page-3.png"}}
        ]}
    ],
    max_tokens=8192
)

print(response.choices[0].message.content)

视频输入用于 Agent QA

# 分析录屏,找出 UI 问题
response = client.chat.completions.create(
    model="alibaba/qwen3.8-max",
    messages=[
        {"role": "user", "content": [
            {"type": "text", "text": "观看这段用户完成结账流程的录屏。识别任何 UX 问题、交互故障或视觉缺陷,每个问题附带时间戳。"},
            {"type": "video_url", "video_url": {"url": "https://example.com/checkout-recording.mp4"}}
        ]}
    ],
    max_tokens=4096
)

注意: SandBase 对 Qwen 3.8 Max 的支持即将上线。以上代码示例基于阿里巴巴公布的 API 规格。模型在平台正式上线后,我们会更新本节内容。

开源发布(下周)

阿里巴巴已宣布 Qwen 3.8 Max 权重将于下周开源。这将是 Qwen 系列中首个开放发布的 Max 级别模型。此前的 Max 模型(3.5 Max、3.6 Max、3.7 Max)均为 API-only。

这一决定意义重大:

  1. 大规模自托管:拥有基础设施的组织(2.4T 模型可能需要多节点 GPU 集群)可在本地运行,确保数据主权
  2. 微调潜力:开放权重使 API-only 无法实现的领域特定适配成为可能
  3. 社区研究:2.4T 参数的 MoE 架构将成为可供研究的最大开放模型
  4. 竞争压力:这将推动其他实验室在前沿级别走向开放

权重发布后,我们会发布专门的自托管指南和量化版本说明。

何时选择 Qwen 3.8 Max

适合选择 Qwen 3.8 Max 的场景:

  • 需要顶级推理能力和多模态输入统一在同一模型中——不再需要文本和视觉变体之间分流
  • Agent 工作流需要处理文档、截图或视频,同时处理代码和文本
  • 追求 Arena 第二的性能,但成本仅为 Fable 5 或 Opus 4.8 的零头
  • 长周期自主 Agent 是主要场景,需要 1M 上下文配合激进缓存策略
  • 正在构建端到端办公自动化 Agent,处理多样化输入类型

不适合的场景:

  • 仅需文本推理且成本敏感——Qwen 3.7 Max 的 $1.25/$3.75 仍然更便宜
  • 需要经过验证的 benchmark 分数才能做决策(等待独立评估发布)
  • 美国/欧盟数据驻留是硬性要求
  • 不计成本追求绝对最强模型(Fable 5 仍然 Arena 第一)
  • 需要立即可用的最强开源模型——权重下周到,不是现在

Qwen 3.8 Max vs. Qwen 3.7 Max:升级决策

因素Qwen 3.7 MaxQwen 3.8 Max结论
输入价格$1.25/M$2.00/M3.7 更便宜
输出价格$3.75/M$6.00/M3.7 更便宜
多模态3.8 胜出
架构Dense(较小)2.4T MoE(95B 激活)3.8 更大
Arena 排名较低全场第 23.8 胜出
开源权重下周3.8 胜出
Benchmark 数据已公布(SWE-Pro 60.6)仅 Arena(暂时)3.7 更透明

升级建议:如果需要多模态输入、追求最强可用推理能力、或计划在权重发布后自托管。

留在 3.7 的理由:工作负载为纯文本、对成本敏感、且已公布的 benchmark 让你确信 3.7 满足质量要求。

常见问题

Qwen 3.8 Max 与 Claude Fable 5 相比如何?

Fable 5 占据 Arena 第一,被广泛认为是 2026 年 8 月最强模型。Qwen 3.8 Max 排名第二——有意义地接近,但在最困难的推理任务上尚未追平。关键差异在价格:Fable 5 的 $20/$100 每百万 token vs Qwen 3.8 Max 的 $2/$6。对于绝大多数 Agent 工作负载,质量差距不足以证明 10-17 倍的价格溢价是合理的。

目前有独立 benchmark 成绩吗?

尚无完整数据。截至发布日(2026 年 8 月 3 日),主要独立验证来自 Arena.AI 的众包排名,Qwen 3.8 Max 在文本类别中排名全场第二。预计阿里巴巴和第三方评估机构将在未来数日公布结构化 benchmark 结果(SWE-Pro、Terminal-Bench、GPQA 等)。届时我们将更新本文。

Qwen 3.8 Max 何时可在 SandBase 上使用?

SandBase 正在完成 Qwen 3.8 Max 的集成工作。预计在官方发布后数日内上线。模型将以 alibaba/qwen3.8-max 通过标准 OpenAI 兼容接口提供,定价与阿里巴巴官方费率一致。

可以自托管 Qwen 3.8 Max 吗?

目前还不行,但下周可以。阿里巴巴已承诺开源权重——这将是首个可自托管的 Max 级别 Qwen 模型。考虑到 2.4T 总参数量,预计需要强大的基础设施(高显存 GPU 多节点集群)。社区量化版本预计会在权重发布后数日内出现。

它支持哪些输入模态?

Qwen 3.8 Max 原生接受文本、图像、视频和文档(PDF 渲染为图像)输入。输出仍为纯文本(包括结构化 JSON、代码和函数调用)。这使其适合需要”看”和”读”多样化输入,同时产出可执行文本或代码的 Agent 工作流。

延伸阅读