Qwen 3.7 Max:阿里 Agent 旗舰,2026 年中最强性价比

Qwen 3.7 Max 是阿里的 Agent 旗舰模型:1M 上下文、SWE-Pro 60.6、Terminal-Bench 69.7。性能追平西方前沿,价格只有 Claude Opus 的 1/20。本文详解 benchmark、定价与实战用法。

TL;DR — SWE-Pro 60.6%,Terminal-Bench 69.7%,通过 SandBase 调用 $1.25/$3.75 每百万 token(缓存命中 $0.25/M)。跑长时间 Agent 循环,这是我今年见过性价比最高的选择。

换默认模型那一刻

上周在跑一个 140 轮的重构 Agent,用的是 Claude Opus 4.7。任务完成没问题——4 小时自主编码,跨 23 个文件改完。账单:$47。大部分是缓存后的 prompt token 费用,但 Opus 的费率下即便缓存行也肉疼。

换成 Qwen 3.7 Max,同一个任务,同一套 system prompt,同样的 tool definitions。4.5 小时跑完——单轮稍慢但最终结果质量相当。账单:$2.80。

不是打错了。同样的质量门槛通过。便宜 17 倍。

先说清楚:我不认为 Qwen 3.7 Max 在每个维度都比 Opus 强。最难的一次性推理问题,Opus 仍然赢。但对于日常 Agent 工作——跨文件重构、测试生成、仓库级 bug 定位——差距已经合拢,价格差距却没有。在生产环境里,你能跑 50 次的模型,比只好 3% 但只跑得起一次的模型更重要。

如果你关注最佳自主 Agent 模型的讨论,Qwen 3.7 Max 就是那个改写算术的选手。

规格一览

维度Qwen 3.7 MaxQwen 3.7 Plus
上下文窗口1,000,000 tokens1,000,000 tokens
最大输出65,536 tokens65,536 tokens
视觉输入
扩展思维
Function Calling
结构化输出
推理力度控制
执行模式同步 + 流式同步 + 流式

Max 是推理主力——纯文本,带原生扩展思维,专攻多步骤复杂问题。Plus 牺牲思维深度换来视觉输入能力,更适合需要处理截图、文档或视觉素材的多模态 Agent 流程。

Benchmark 表现

BenchmarkQwen 3.7 MaxClaude Opus 4.6GPT-5.5DeepSeek V4
SWE-Pro60.6%57.3%55.8%52.1%
Terminal-Bench 2.069.7%65.4%63.2%58.9%
GPQA Diamond92.4%90.1%91.7%88.6%
SWE-Bench Verified80.4%82.1%83.5%76.3%
HMMT 2026 Feb97.1%95.2%96.8%93.4%
MCP-Atlas76.4%75.8%78.2%71.5%
Artificial Analysis Index56.6 (#5)58.2 (#3)59.1 (#1)53.8 (#8)

规律很清晰:Qwen 3.7 Max 在 Agent 类 benchmark 上领先——SWE-Pro 和 Terminal-Bench 考核的正是持续执行和工具编排能力。GPT-5.5 和 Claude 在单次推理的孤立任务上仍有优势。但对 Agent 开发者来说,Agent benchmark 才是预测真实表现的指标。

值得注意的是 SWE-Pro 和标准 SWE-Bench 的差异。SWE-Bench Verified 只要求模型完成一个相对清晰的代码修复任务;SWE-Pro 则要求模型从头理解项目架构、自主规划修复路径、执行多步操作。后者的评估方式更接近真实的 Agent 工作流。Qwen 3.7 Max 在 SWE-Pro 上 3.3 个百分点的领先,反映的是它在复杂多步执行中的稳定性优势。

Terminal-Bench 2.0 同样值得单独说明。这个 benchmark 要求模型在终端环境中完成复杂的系统管理和调试任务——不是简单的命令补全,而是需要诊断问题、制定方案、连续执行多条命令并根据输出调整策略。69.7% 的得分意味着近七成的真实终端任务它能自主搞定。

SandBase 定价

模型输入(每 1M)输出(每 1M)缓存读取倍率缓存后有效输入价
Qwen 3.7 Max$1.25$3.750.2x$0.25
Claude Opus 4.7$15.00$75.000.1x$1.50
GPT-5.5$5.00$15.000.5x$2.50
DeepSeek V4 Pro$2.19$8.780.25x$0.55

Agent 工作负载的成本逻辑:编码 Agent 每次迭代发送不断增长的上下文。Prompt 缓存 0.2x 意味着重复上下文只要 $0.25/M——比 Claude Opus 缓存输入便宜 60 倍,比 GPT-5.5 便宜 10 倍。

举个具体数字:一个 100 轮迭代的 Agent 会话,每轮发送 500K 上下文。用 Qwen 3.7 Max 的输入成本是 $12.50;换 Claude Opus 是 $750。差距整整 60 倍。

DashScope 官方价是 $2.50/$7.50。通过 SandBase 访问只要 $1.25/$3.75——打五折,同样的 OpenAI 兼容 endpoint,同样的流式输出,同样的工具调用协议。

这个价格优势对团队意味着什么?如果你跑 10 个并行 Agent 实例、每个每天执行 50 轮迭代,月成本可以从数万美元压缩到不到两千。这不只是”省钱”——它让很多之前因为成本而不可行的 Agent 架构变得可行。比如:每次提交自动跑一遍全仓库代码审查、或者让 Agent 在后台持续监控和修复 CI 流水线问题。

在 Agent 中使用

通过 SandBase 的标准 OpenAI SDK 调用:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.sandbase.ai/v1",
    api_key="your-sandbase-key"
)

response = client.chat.completions.create(
    model="alibaba/qwen3.7-max",
    messages=[
        {"role": "system", "content": "You are a senior engineer. Fix bugs by reading the full codebase first, then making minimal targeted changes."},
        {"role": "user", "content": "The authentication middleware is rejecting valid tokens after server restart. Here's the full codebase: ..."}
    ],
    tools=[{
        "type": "function",
        "function": {
            "name": "edit_file",
            "description": "Edit a file at the given path",
            "parameters": {
                "type": "object",
                "properties": {
                    "path": {"type": "string"},
                    "content": {"type": "string"}
                },
                "required": ["path", "content"]
            }
        }
    }],
    max_tokens=16384,
    stream=True
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Plus 变体处理视觉任务:

response = client.chat.completions.create(
    model="alibaba/qwen3.7-plus",
    messages=[
        {"role": "user", "content": [
            {"type": "text", "text": "Extract all form fields and their validation rules from this screenshot."},
            {"type": "image_url", "image_url": {"url": "https://example.com/form-screenshot.png"}}
        ]}
    ],
    max_tokens=4096
)

同一个 endpoint,同一个 API key,同一套计费。把 alibaba/qwen3.7-max 换成 alibaba/qwen3.7-plus 就能拿到图像理解能力。

什么时候该选 Qwen 3.7 Max

适合的场景:

  • 长周期编码 Agent(多文件重构、全仓库 bug 排查),单次迭代成本主导总开销
  • Agent 会话上下文经常超过 100K token,prompt 缓存是刚需
  • 需要 SWE-Pro 级别的性能,但预算无法承受前沿定价
  • 持续自主执行是核心流程——论小时而非论分钟

不适合的场景:

  • 需要视觉推理参与决策回路(用 Qwen 3.7 Plus,或 Claude Sonnet 5 获得最强多模态推理)
  • 有美国或欧盟数据驻留要求(DashScope 走阿里云全球基础设施)
  • 追求单次推理在全新难题上的绝对最优解(GPT-5.5 和 Claude Opus 仍有微弱优势)
  • 需要开源权重自托管(Qwen 3.7 Max 闭源;开源需求请看 Qwen 3.6DeepSeek V4

3.7 系列阵容

阿里在 3.7 世代推出两个变体:

  • Qwen 3.7 Max — 纯文本旗舰,带扩展思维。编码 Agent、长上下文推理、需要模型先想清楚再行动的复杂任务首选。扩展思维模式让它在遇到复杂问题时会先生成内部推理链,然后再输出最终答案——类似人类先打草稿再写正文。
  • Qwen 3.7 Plus — 支持视觉输入,性价比导向。更适合多模态管线、文档处理、基于截图的工作流——这些场景输入广度比思维深度重要。如果你的 Agent 需要看 UI 截图来决定下一步操作,Plus 是正确选择。

两者共享 1M 上下文窗口,都支持 function calling 和结构化输出。核心取舍:思维深度(Max) vs 模态广度(Plus)。

实战中的常见组合:用 Max 做核心的代码推理和修改决策,用 Plus 做 UI 验证和文档解析。两个模型通过同一个 SandBase endpoint 调用,切换只需改模型名,不需要重构代码。

FAQ

Qwen 3.7 Max 做编码 Agent 比 Claude Opus 4.7 强吗?

在持续性 Agent 编码 benchmark 上,是的。Qwen 3.7 Max 在 SWE-Pro(60.6 vs 57.3)和 Terminal-Bench(69.7 vs 65.4)上领先——这些任务最接近真实 Agent 工作负载。Claude 在一次性推理和最难的全新问题上仍有优势。对典型的迭代式工具调用编码 Agent 而言,Qwen 3.7 Max 效果相当甚至更好,而输出成本只有 1/20。

Qwen 3.7 Max 能本地部署吗?

不能。截至 2026 年 8 月,Qwen 3.7 Max 没有开放权重,只能通过 API 访问——DashScope 直连,或通过 SandBase 等路由平台。自托管需求建议看 Qwen 3.6-27B,这是 Qwen 家族中最好的开源替代。

缓存读取倍率是什么意思?

通过 SandBase,缓存命中的 prompt token 只按标准输入价的 0.2x 计费——即重复上下文只要 $0.25 每百万 token。对长 Agent 会话意义重大:系统提示、代码库、对话历史在每轮之间大部分相同,缓存让这些重复成本接近于零。

Qwen 3.7 Plus 和 Max 有什么区别?

Plus 增加了视觉输入(图片和截图),但没有扩展思维模式。多模态 Agent 流程用 Plus;深度推理的纯文本任务(代码生成、规划、分析)用 Max。

SandBase 走哪个供应商?

SandBase 以阿里 DashScope(百炼平台)为主力路由。模型标识为 alibaba/qwen3.7-maxalibaba/qwen3.7-plus,通过标准 OpenAI 兼容的 /v1/chat/completions endpoint 调用。

延伸阅读