DeepSeek V4 Flash:$0.28 干翻旗舰
DeepSeek V4 Flash 0731 正式发布:Terminal-Bench 82.7、DeepSWE 54.4,9 项 Agent 基准全面超越 V4-Pro-Preview。284B/13B MoE 架构,1M 上下文,MIT 开源,$0.14/$0.28 每百万 token。
DeepSWE 从 7.3 涨到 54.4——645% 的提升,架构一行没改,纯靠 post-training 拉上来的。更离谱的是,这个 Flash 版在 9 项 Agent 基准上全面超越了自家还没正式发布的旗舰 V4-Pro-Preview。说白了,DeepSeek 让便宜货先把贵的干掉了。
先说结论
- DeepSeek V4 Flash 0731 是目前性价比最高的 Agent 模型:输出 $0.28/百万 token,比 V4-Pro 便宜 12 倍
- 架构不变(284B 总参 / 13B 激活 MoE),纯靠 post-training 把 DeepSWE 从 7.3 拉到 54.4(+645%)
- 9 项 Agent 基准全面超越 V4-Pro-Preview,MIT 开源,权重直接下载
- 适合:Coding Agent、长文档处理、高并发批量任务、成本敏感场景
发生了什么
2026 年 7 月 31 日,DeepSeek 把 V4 Flash 从 Preview 升级为正式版(public beta)。注意,这次更新只动了 API,网页版和 V4-Pro 都没变。
有意思的是,从 Preview 到正式版,模型架构和预训练权重完全没动,所有提升都来自 post-training 阶段的优化。这意味着 DeepSeek 的 post-training pipeline 已经强到可以在不碰底座的情况下把 Agent 能力拉升一个数量级。
模型规格
| 参数 | 数值 |
|---|---|
| 总参数量 | 284B(含 DSpark 推测解码模块后 304B) |
| 每 token 激活参数 | 13B |
| 架构 | MoE(Mixture of Experts) |
| 上下文窗口 | 1,000,000 token |
| 最大输出长度 | 384,000 token |
| 并发请求数 | 2,500(V4-Pro 为 500) |
| 许可证 | MIT |
| 权重 | HuggingFace 开源 |
| API 兼容 | Responses API + Codex 原生支持 |
说白了,284B 的总参里每次推理只激活 13B,这就是 MoE 的核心优势——模型容量大但推理成本低。配合 DSpark 推测解码,吞吐量进一步拉满。
定价对比
| 模型 | 输入($/百万 token) | 输出($/百万 token) | 缓存命中 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | $0.003 |
| DeepSeek V4-Pro | $1.74 | $3.48 | — |
| Claude Opus 4.7 | $15.00 | $75.00 | — |
这个价格差距不用多解释了。V4 Flash 的输出价格是 V4-Pro 的 1/12,是 Claude Opus 4.7 的 1/267。加上缓存命中 $0.003 的输入成本,跑长上下文的 Agent 任务几乎不要钱。
Agent 基准:这个数据比较炸裂
| 基准 | V4 Flash 0731 | V4 Flash Preview | V4-Pro-Preview |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 61.8 | 72.1 |
| DeepSWE | 54.4 | 7.3 | — |
| SWE-bench Verified | 79% | — | — |
| Artificial Analysis 智能指数 | 50 | — | 中位数 17 |
几个关键数字:
- Terminal-Bench 82.7:比 V4-Pro-Preview 的 72.1 高出 14.7%,而且 Flash 版价格只有 Pro 的零头。
- DeepSWE 54.4:从 Preview 的 7.3 暴涨 645%。这不是渐进式提升,这是质变。
- 9 项 Agent 基准全面超越 V4-Pro-Preview:便宜版全方位碾压贵的版本,DeepSeek 的定价策略属实是把自己卷进去了。
- Artificial Analysis 智能指数 50:行业中位数只有 17,Flash 几乎是中位数的 3 倍。
需要说明的是:以上数据均来自 DeepSeek 官方报告,第三方独立复现尚未完成。SWE-bench Verified 的 79% 是相对可验证的(有公开方法论),其他数字仍需等待社区确认。
为什么 Flash 能反超 Pro
这个问题很多人在问。我的理解是:
- Post-training 的针对性优化:Flash 正式版专门针对 Agent 场景做了大量 RLHF / DPO 训练,而 V4-Pro-Preview 还停留在更通用的优化阶段。
- 发布节奏的差异:Pro 还是 Preview 状态,Flash 先完成了正式版的打磨。后续 V4-Pro 正式版大概率还会反超,但现在这个时间窗口,Flash 就是最强的。
- MoE 架构的天然优势:13B 激活参数意味着更快的迭代速度,post-training 实验的反馈周期短,调优效率高。
适用场景
我这几天主要在 Coding Agent 和长文档处理两个方向测了测,分享下观感:
- Coding Agent:SWE-bench 79%,Terminal-Bench 82.7,跑 Codex 任务的首选。我用它跑了几个 GitHub issue 修复任务,体感确实比 Preview 版靠谱不少。
- 长文档处理:1M 上下文 + 384K 输出,适合代码仓库级别的分析和生成。
- 高并发服务:2,500 并发是 V4-Pro 的 5 倍,适合 toB 场景。
- 成本敏感的批量任务:缓存命中 $0.003,大规模跑 Agent pipeline 的成本极低。
想了解更多 DeepSeek V4 系列的架构细节,可以看我们之前的文章:DeepSeek V4 开源百万上下文详解。如果你在对比各家百万上下文模型的性价比,还可以参考最佳百万上下文模型对比。
DSpark 推测解码
DSpark 是 DeepSeek 自研的推测解码模块,额外增加 20B 参数(总计 304B)。工作原理是预测后续多个 token,再由主模型验证。效果是降低生成延迟,不影响输出质量。
对于 Agent 场景来说,长输出(完整代码文件、多步计划)的生成速度显著提升。这是 Flash 版能维持高并发的原因之一。
本地部署
MIT 协议意味着你可以:
- 商用,无限制
- 修改权重,微调
- 二次分发
284B 总参的 MoE 模型,推理时只激活 13B,显存需求远低于同规模 Dense 模型。如果你已经在跑 vLLM 或 SGLang 的 MoE 推理,可以直接换 checkpoint。
FAQ
Q:V4 Flash 0731 和 Preview 版有什么区别?
架构和预训练权重完全一样,区别在 post-training。正式版在 Agent、Coding 相关任务上有数量级的提升(DeepSWE 从 7.3 → 54.4)。
Q:MIT 开源意味着什么?
可以商用、可以修改、可以二次分发,没有任何限制。权重在 HuggingFace 上直接下载。
Q:该选 Flash 还是 Pro?
现阶段选 Flash。价格低 12 倍,Agent 基准全面领先。除非你有特定任务在 Pro 上表现更好的实测数据,否则没有理由多花钱。
Q:本地部署需要什么配置?
284B 总参的 MoE 模型,实际推理时只激活 13B,显存需求远低于同参数量的 Dense 模型。具体配置取决于量化方案和批处理大小,建议关注社区的部署实践。
Q:缓存命中 $0.003 是怎么算的?
当你的请求前缀与之前的请求匹配时(比如 System Prompt 不变),匹配部分按 $0.003/百万 token 计费,比正常输入便宜 46 倍。跑固定 pipeline 的场景收益最大。
总结
DeepSeek V4 Flash 0731 证明了一件事:post-training 的天花板比大家想象的要高得多。同一个底座,优化前后在 Agent 任务上可以有 6-7 倍的差距。对于开发者来说,现在就是切换到 Flash 的最佳时机——便宜、快、强,还开源。


