Qwen 3.7 Max:阿里 Agent 旗舰,2026 年中最强性价比
Qwen 3.7 Max 是阿里的 Agent 旗舰模型:1M 上下文、SWE-Pro 60.6、Terminal-Bench 69.7。性能追平西方前沿,价格只有 Claude Opus 的 1/20。本文详解 benchmark、定价与实战用法。
TL;DR — SWE-Pro 60.6%,Terminal-Bench 69.7%,通过 SandBase 调用 $1.25/$3.75 每百万 token(缓存命中 $0.25/M)。跑长时间 Agent 循环,这是我今年见过性价比最高的选择。
换默认模型那一刻
上周在跑一个 140 轮的重构 Agent,用的是 Claude Opus 4.7。任务完成没问题——4 小时自主编码,跨 23 个文件改完。账单:$47。大部分是缓存后的 prompt token 费用,但 Opus 的费率下即便缓存行也肉疼。
换成 Qwen 3.7 Max,同一个任务,同一套 system prompt,同样的 tool definitions。4.5 小时跑完——单轮稍慢但最终结果质量相当。账单:$2.80。
不是打错了。同样的质量门槛通过。便宜 17 倍。
先说清楚:我不认为 Qwen 3.7 Max 在每个维度都比 Opus 强。最难的一次性推理问题,Opus 仍然赢。但对于日常 Agent 工作——跨文件重构、测试生成、仓库级 bug 定位——差距已经合拢,价格差距却没有。在生产环境里,你能跑 50 次的模型,比只好 3% 但只跑得起一次的模型更重要。
如果你关注最佳自主 Agent 模型的讨论,Qwen 3.7 Max 就是那个改写算术的选手。
规格一览
| 维度 | Qwen 3.7 Max | Qwen 3.7 Plus |
|---|---|---|
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 65,536 tokens | 65,536 tokens |
| 视觉输入 | 否 | 是 |
| 扩展思维 | 是 | 否 |
| Function Calling | 是 | 是 |
| 结构化输出 | 是 | 是 |
| 推理力度控制 | — | — |
| 执行模式 | 同步 + 流式 | 同步 + 流式 |
Max 是推理主力——纯文本,带原生扩展思维,专攻多步骤复杂问题。Plus 牺牲思维深度换来视觉输入能力,更适合需要处理截图、文档或视觉素材的多模态 Agent 流程。
Benchmark 表现
| Benchmark | Qwen 3.7 Max | Claude Opus 4.6 | GPT-5.5 | DeepSeek V4 |
|---|---|---|---|---|
| SWE-Pro | 60.6% | 57.3% | 55.8% | 52.1% |
| Terminal-Bench 2.0 | 69.7% | 65.4% | 63.2% | 58.9% |
| GPQA Diamond | 92.4% | 90.1% | 91.7% | 88.6% |
| SWE-Bench Verified | 80.4% | 82.1% | 83.5% | 76.3% |
| HMMT 2026 Feb | 97.1% | 95.2% | 96.8% | 93.4% |
| MCP-Atlas | 76.4% | 75.8% | 78.2% | 71.5% |
| Artificial Analysis Index | 56.6 (#5) | 58.2 (#3) | 59.1 (#1) | 53.8 (#8) |
规律很清晰:Qwen 3.7 Max 在 Agent 类 benchmark 上领先——SWE-Pro 和 Terminal-Bench 考核的正是持续执行和工具编排能力。GPT-5.5 和 Claude 在单次推理的孤立任务上仍有优势。但对 Agent 开发者来说,Agent benchmark 才是预测真实表现的指标。
值得注意的是 SWE-Pro 和标准 SWE-Bench 的差异。SWE-Bench Verified 只要求模型完成一个相对清晰的代码修复任务;SWE-Pro 则要求模型从头理解项目架构、自主规划修复路径、执行多步操作。后者的评估方式更接近真实的 Agent 工作流。Qwen 3.7 Max 在 SWE-Pro 上 3.3 个百分点的领先,反映的是它在复杂多步执行中的稳定性优势。
Terminal-Bench 2.0 同样值得单独说明。这个 benchmark 要求模型在终端环境中完成复杂的系统管理和调试任务——不是简单的命令补全,而是需要诊断问题、制定方案、连续执行多条命令并根据输出调整策略。69.7% 的得分意味着近七成的真实终端任务它能自主搞定。
SandBase 定价
| 模型 | 输入(每 1M) | 输出(每 1M) | 缓存读取倍率 | 缓存后有效输入价 |
|---|---|---|---|---|
| Qwen 3.7 Max | $1.25 | $3.75 | 0.2x | $0.25 |
| Claude Opus 4.7 | $15.00 | $75.00 | 0.1x | $1.50 |
| GPT-5.5 | $5.00 | $15.00 | 0.5x | $2.50 |
| DeepSeek V4 Pro | $2.19 | $8.78 | 0.25x | $0.55 |
Agent 工作负载的成本逻辑:编码 Agent 每次迭代发送不断增长的上下文。Prompt 缓存 0.2x 意味着重复上下文只要 $0.25/M——比 Claude Opus 缓存输入便宜 60 倍,比 GPT-5.5 便宜 10 倍。
举个具体数字:一个 100 轮迭代的 Agent 会话,每轮发送 500K 上下文。用 Qwen 3.7 Max 的输入成本是 $12.50;换 Claude Opus 是 $750。差距整整 60 倍。
DashScope 官方价是 $2.50/$7.50。通过 SandBase 访问只要 $1.25/$3.75——打五折,同样的 OpenAI 兼容 endpoint,同样的流式输出,同样的工具调用协议。
这个价格优势对团队意味着什么?如果你跑 10 个并行 Agent 实例、每个每天执行 50 轮迭代,月成本可以从数万美元压缩到不到两千。这不只是”省钱”——它让很多之前因为成本而不可行的 Agent 架构变得可行。比如:每次提交自动跑一遍全仓库代码审查、或者让 Agent 在后台持续监控和修复 CI 流水线问题。
在 Agent 中使用
通过 SandBase 的标准 OpenAI SDK 调用:
from openai import OpenAI
client = OpenAI(
base_url="https://api.sandbase.ai/v1",
api_key="your-sandbase-key"
)
response = client.chat.completions.create(
model="alibaba/qwen3.7-max",
messages=[
{"role": "system", "content": "You are a senior engineer. Fix bugs by reading the full codebase first, then making minimal targeted changes."},
{"role": "user", "content": "The authentication middleware is rejecting valid tokens after server restart. Here's the full codebase: ..."}
],
tools=[{
"type": "function",
"function": {
"name": "edit_file",
"description": "Edit a file at the given path",
"parameters": {
"type": "object",
"properties": {
"path": {"type": "string"},
"content": {"type": "string"}
},
"required": ["path", "content"]
}
}
}],
max_tokens=16384,
stream=True
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Plus 变体处理视觉任务:
response = client.chat.completions.create(
model="alibaba/qwen3.7-plus",
messages=[
{"role": "user", "content": [
{"type": "text", "text": "Extract all form fields and their validation rules from this screenshot."},
{"type": "image_url", "image_url": {"url": "https://example.com/form-screenshot.png"}}
]}
],
max_tokens=4096
)
同一个 endpoint,同一个 API key,同一套计费。把 alibaba/qwen3.7-max 换成 alibaba/qwen3.7-plus 就能拿到图像理解能力。
什么时候该选 Qwen 3.7 Max
适合的场景:
- 长周期编码 Agent(多文件重构、全仓库 bug 排查),单次迭代成本主导总开销
- Agent 会话上下文经常超过 100K token,prompt 缓存是刚需
- 需要 SWE-Pro 级别的性能,但预算无法承受前沿定价
- 持续自主执行是核心流程——论小时而非论分钟
不适合的场景:
- 需要视觉推理参与决策回路(用 Qwen 3.7 Plus,或 Claude Sonnet 5 获得最强多模态推理)
- 有美国或欧盟数据驻留要求(DashScope 走阿里云全球基础设施)
- 追求单次推理在全新难题上的绝对最优解(GPT-5.5 和 Claude Opus 仍有微弱优势)
- 需要开源权重自托管(Qwen 3.7 Max 闭源;开源需求请看 Qwen 3.6 或 DeepSeek V4)
3.7 系列阵容
阿里在 3.7 世代推出两个变体:
- Qwen 3.7 Max — 纯文本旗舰,带扩展思维。编码 Agent、长上下文推理、需要模型先想清楚再行动的复杂任务首选。扩展思维模式让它在遇到复杂问题时会先生成内部推理链,然后再输出最终答案——类似人类先打草稿再写正文。
- Qwen 3.7 Plus — 支持视觉输入,性价比导向。更适合多模态管线、文档处理、基于截图的工作流——这些场景输入广度比思维深度重要。如果你的 Agent 需要看 UI 截图来决定下一步操作,Plus 是正确选择。
两者共享 1M 上下文窗口,都支持 function calling 和结构化输出。核心取舍:思维深度(Max) vs 模态广度(Plus)。
实战中的常见组合:用 Max 做核心的代码推理和修改决策,用 Plus 做 UI 验证和文档解析。两个模型通过同一个 SandBase endpoint 调用,切换只需改模型名,不需要重构代码。
FAQ
Qwen 3.7 Max 做编码 Agent 比 Claude Opus 4.7 强吗?
在持续性 Agent 编码 benchmark 上,是的。Qwen 3.7 Max 在 SWE-Pro(60.6 vs 57.3)和 Terminal-Bench(69.7 vs 65.4)上领先——这些任务最接近真实 Agent 工作负载。Claude 在一次性推理和最难的全新问题上仍有优势。对典型的迭代式工具调用编码 Agent 而言,Qwen 3.7 Max 效果相当甚至更好,而输出成本只有 1/20。
Qwen 3.7 Max 能本地部署吗?
不能。截至 2026 年 8 月,Qwen 3.7 Max 没有开放权重,只能通过 API 访问——DashScope 直连,或通过 SandBase 等路由平台。自托管需求建议看 Qwen 3.6-27B,这是 Qwen 家族中最好的开源替代。
缓存读取倍率是什么意思?
通过 SandBase,缓存命中的 prompt token 只按标准输入价的 0.2x 计费——即重复上下文只要 $0.25 每百万 token。对长 Agent 会话意义重大:系统提示、代码库、对话历史在每轮之间大部分相同,缓存让这些重复成本接近于零。
Qwen 3.7 Plus 和 Max 有什么区别?
Plus 增加了视觉输入(图片和截图),但没有扩展思维模式。多模态 Agent 流程用 Plus;深度推理的纯文本任务(代码生成、规划、分析)用 Max。
SandBase 走哪个供应商?
SandBase 以阿里 DashScope(百炼平台)为主力路由。模型标识为 alibaba/qwen3.7-max 和 alibaba/qwen3.7-plus,通过标准 OpenAI 兼容的 /v1/chat/completions endpoint 调用。


