2026 LLM API 定价全指南
2026 年 LLM API 实用定价参考:GPT-4o、Claude、DeepSeek、Gemini 的 input/output/cache 费率及真实场景费用计算。
先说结论 — 2026 年 LLM API 定价分三档:旗舰($2.50-$15/M input tokens)、中档($0.15-$2.50/M)、预算档($0-$0.50/M)。Cache 命中能省 50-90%。Agent 的真实费用不是模型单价,是 单价 × token 数 × 每天调用次数 × 天数。本文给你每个主流模型的实际月费计算。
定价页告诉你 $2.50/百万 input tokens。它没告诉你的是:你的 agent 每轮用 4,000 tokens、每天跑 50 轮,月账单会是 $15 还是 $150——取决于你选哪个模型和能不能命中 cache。
本文把公开定价翻译成真实场景的月费。
2026 定价全景
旗舰档
| 模型 | Input($/M tokens) | Output($/M tokens) | Context | 适合 |
|---|---|---|---|---|
| GPT-4o | $2.50 | $10.00 | 128K | 通用、视觉、工具调用 |
| Claude Opus 4.7 | $15.00 | $75.00 | 200K | 复杂推理、长文档 |
| Claude Sonnet 4 | $3.00 | $15.00 | 200K | 代码、agent、性价比平衡 |
| Gemini 1.5 Pro | $3.50 | $10.50 | 2M | 超长上下文、多模态 |
中档
| 模型 | Input | Output | Context | 适合 |
|---|---|---|---|---|
| GPT-4o-mini | $0.15 | $0.60 | 128K | 高频、成本敏感 |
| Claude Haiku 3.5 | $0.80 | $4.00 | 200K | 快速分类、路由 |
| Gemini 1.5 Flash | $0.075 | $0.30 | 1M | 批量处理、长上下文便宜 |
| DeepSeek V4 | $0.27 | $1.10 | 128K | 代码、开放权重替代 |
预算档
| 模型 | Input | Output | Context | 适合 |
|---|---|---|---|---|
| Qwen3-32B(免费档) | $0.00 | $0.00 | 131K | 原型、低风险任务 |
| DeepSeek V4 Flash | $0.07 | $0.28 | 1M | 预算长上下文 |
| Gemini Flash 8B | $0.0375 | $0.15 | 1M | 极端量、简单任务 |
价格截至 2026 年 7 月,来自各厂商官方定价页。SandBase 透传 provider 定价,具体费率以模型目录为准。
真实费用计算
模式 1:每日简报 agent(30 轮/天)
| 模型 | 每轮 tokens | 轮/天 | 日费用 | 月费 |
|---|---|---|---|---|
| Claude Sonnet 4 | 3,000 in + 800 out | 30 | $0.63 | $18.90 |
| GPT-4o | 3,000 in + 800 out | 30 | $0.47 | $14.10 |
| GPT-4o-mini | 3,000 in + 800 out | 30 | $0.03 | $0.90 |
| DeepSeek V4 | 3,000 in + 800 out | 30 | $0.05 | $1.50 |
Sonnet 4 和 4o-mini 之间 20 倍的费用差——前者需要审批,后者是个零头。
模式 2:分类 agent(500 次/天)
| 模型 | 每次 tokens | 次/天 | 日费用 | 月费 |
|---|---|---|---|---|
| Claude Haiku 3.5 | 500 in + 50 out | 500 | $0.30 | $9.00 |
| GPT-4o-mini | 500 in + 50 out | 500 | $0.05 | $1.50 |
| Gemini Flash 8B | 500 in + 50 out | 500 | $0.01 | $0.30 |
分类场景:满足准确率的最便宜模型赢。先测准确率再优化成本。
模式 3:长文档分析(10K+ token 输入)
| 模型 | 输入 tokens | 输出 | 单次费用 | 100 篇/月 |
|---|---|---|---|---|
| Claude Opus 4.7 | 50,000 | 2,000 | $0.90 | $90 |
| Claude Sonnet 4 | 50,000 | 2,000 | $0.18 | $18 |
| Gemini 1.5 Flash | 50,000 | 2,000 | $0.004 | $0.40 |
Gemini Flash 处理 5 万 token 比 Opus 便宜 225 倍。质量有差距——但抽取任务(从合同里拉特定字段)Flash 经常够用。
Cache:隐藏的成本杠杆
| 厂商 | Cache 写入 | Cache 命中 | 节省 |
|---|---|---|---|
| Anthropic | 1.25× 基础 input | 0.1× 基础 input | 90% |
| OpenAI | 1× 基础 input(自动) | 0.5× 基础 input | 50% |
| 1× 基础 input | 0.25× 基础 input | 75% |
Cache 对 agent 的实际影响
典型 agent 有:系统提示 2,000 tokens(可缓存)+ 工具定义 1,500 tokens(可缓存)+ 对话历史 500-5,000(变化)+ 新输入 200(不可缓存)。
Claude Sonnet 4 上 3,500 个可缓存 token 的差异:
| 场景 | 单次 input 费 | 月费(30 次/天) |
|---|---|---|
| 无 cache | $0.0105 | $9.45 |
| 有 cache(90% 命中) | $0.0015 | $1.35 |
| 节省 | $8.10/月(86%) |
Cache 对生产 agent 不是可选的。它是最大的单一成本压缩杠杆。
Anthropic 新的分级 cache(2026)
| 级别 | TTL | 写入成本 | 读取成本 | 适合 |
|---|---|---|---|---|
| 5 分钟 cache | 5 min | 1.25× input | 0.1× input | 对话式 agent(快速来回) |
| 1 小时 cache | 60 min | 1.5× input | 0.1× input | 批量处理、定时 agent |
对话 agent 每 30 秒一轮:5 分钟 cache 全覆盖。每日简报 agent:1 小时 cache 覆盖整个 session 但写入贵 20%。
真实费用公式
月费 = (input_tokens × input_price + output_tokens × output_price)
× 每天调用次数 × 30
× (1 - cache_命中率 × cache_节省比)
成本优化策略
策略 1:模型级联
便宜模型先分类,贵的只用在需要时:
输入 → 4o-mini(分类)→ 80% 解决 → 完($0.0003/次)
→ 20% 复杂 → Sonnet 4($0.012/次)
混合成本:$0.0027/次
vs 全用 Sonnet:$0.012/次(贵 4.4 倍)
策略 2:Token 预算管理
显式设 max_tokens,不让模型废话:
| 设置 | 典型输出 | 费用影响 |
|---|---|---|
| 不限(模型自决) | 500-2,000 tokens | 不可预测 |
max_tokens: 500 | ≤500 | 封顶可预测 |
max_tokens: 100 | ≤100(分类场景) | 输出成本最小化 |
策略 3:数据预过滤
社媒数据 API $0.001/次不管数据大小。LLM 按 token 计费。如果你把 30 条视频描述(每条 600 token = 18,000 token)全喂给 Sonnet 4:LLM 费 $0.054。如果先用数据 API 过滤到只有新/变化的 3-5 条:$0.009。
用便宜的数据 API 预过滤,再送贵的 LLM——这是最有效的成本优化。
更多按次 vs 按 token 的分析看 按次 vs 按 Token 选型。
FAQ
哪个模型每百万 token 最便宜?
Gemini Flash 8B,$0.0375/M input。但「最便宜」不是正确问题——「满足准确率要求的最便宜」才是。先用你的实际 prompt 测准确率再优化成本。
1M context 真的每次调用花 1M token 的钱?
不是。Context window 是上限,你只为实际发送的 token 付费。1M 上下文模型处理 5,000 token 的 prompt 和 128K 模型处理同样 prompt 费用一样。
每天只跑一次的 agent,cache 有意义吗?
通常没有。Cache TTL 是 5-60 分钟。每日 agent 两次调用之间 cache 已过期。Cache 帮的是分钟内多次调用的 agent(对话、批量、快速工具调用)。
怎么预测月 LLM 账单?
跑一天 agent,数总 input/output tokens(大部分 SDK 在响应里暴露 usage)。乘:日 tokens × 单价 × 30。加 20% 余量覆盖重试和边界情况。
基于数据 API 的竞品监控每月只花 $0.90——加上 LLM 分析也不过 $1.20。详见 抖音竞品监控教程。
要点
- 真实费用是
单价 × token 数 × 频率 × 天数,不只是 $/M tokens - Cache 在生产 agent 里省 50-90%,不是可选项
- 模型级联(便宜分类 → 贵的推理)压低混合成本 3-5×
- LLM 之前先用数据 API 预过滤:10 次 $0.001 的调用能省下比换模型更多的钱
- 先测准确率再优化成本。便宜模型给错答案的成本比贵模型贵得多

