2026 LLM API 定价全指南

2026 年 LLM API 实用定价参考:GPT-4o、Claude、DeepSeek、Gemini 的 input/output/cache 费率及真实场景费用计算。

先说结论 — 2026 年 LLM API 定价分三档:旗舰($2.50-$15/M input tokens)、中档($0.15-$2.50/M)、预算档($0-$0.50/M)。Cache 命中能省 50-90%。Agent 的真实费用不是模型单价,是 单价 × token 数 × 每天调用次数 × 天数。本文给你每个主流模型的实际月费计算。

定价页告诉你 $2.50/百万 input tokens。它没告诉你的是:你的 agent 每轮用 4,000 tokens、每天跑 50 轮,月账单会是 $15 还是 $150——取决于你选哪个模型和能不能命中 cache。

本文把公开定价翻译成真实场景的月费。

2026 定价全景

旗舰档

模型Input($/M tokens)Output($/M tokens)Context适合
GPT-4o$2.50$10.00128K通用、视觉、工具调用
Claude Opus 4.7$15.00$75.00200K复杂推理、长文档
Claude Sonnet 4$3.00$15.00200K代码、agent、性价比平衡
Gemini 1.5 Pro$3.50$10.502M超长上下文、多模态

中档

模型InputOutputContext适合
GPT-4o-mini$0.15$0.60128K高频、成本敏感
Claude Haiku 3.5$0.80$4.00200K快速分类、路由
Gemini 1.5 Flash$0.075$0.301M批量处理、长上下文便宜
DeepSeek V4$0.27$1.10128K代码、开放权重替代

预算档

模型InputOutputContext适合
Qwen3-32B(免费档)$0.00$0.00131K原型、低风险任务
DeepSeek V4 Flash$0.07$0.281M预算长上下文
Gemini Flash 8B$0.0375$0.151M极端量、简单任务

价格截至 2026 年 7 月,来自各厂商官方定价页。SandBase 透传 provider 定价,具体费率以模型目录为准。

真实费用计算

模式 1:每日简报 agent(30 轮/天)

模型每轮 tokens轮/天日费用月费
Claude Sonnet 43,000 in + 800 out30$0.63$18.90
GPT-4o3,000 in + 800 out30$0.47$14.10
GPT-4o-mini3,000 in + 800 out30$0.03$0.90
DeepSeek V43,000 in + 800 out30$0.05$1.50

Sonnet 4 和 4o-mini 之间 20 倍的费用差——前者需要审批,后者是个零头。

模式 2:分类 agent(500 次/天)

模型每次 tokens次/天日费用月费
Claude Haiku 3.5500 in + 50 out500$0.30$9.00
GPT-4o-mini500 in + 50 out500$0.05$1.50
Gemini Flash 8B500 in + 50 out500$0.01$0.30

分类场景:满足准确率的最便宜模型赢。先测准确率再优化成本。

模式 3:长文档分析(10K+ token 输入)

模型输入 tokens输出单次费用100 篇/月
Claude Opus 4.750,0002,000$0.90$90
Claude Sonnet 450,0002,000$0.18$18
Gemini 1.5 Flash50,0002,000$0.004$0.40

Gemini Flash 处理 5 万 token 比 Opus 便宜 225 倍。质量有差距——但抽取任务(从合同里拉特定字段)Flash 经常够用。

Cache:隐藏的成本杠杆

厂商Cache 写入Cache 命中节省
Anthropic1.25× 基础 input0.1× 基础 input90%
OpenAI1× 基础 input(自动)0.5× 基础 input50%
Google1× 基础 input0.25× 基础 input75%

Cache 对 agent 的实际影响

典型 agent 有:系统提示 2,000 tokens(可缓存)+ 工具定义 1,500 tokens(可缓存)+ 对话历史 500-5,000(变化)+ 新输入 200(不可缓存)。

Claude Sonnet 4 上 3,500 个可缓存 token 的差异:

场景单次 input 费月费(30 次/天)
无 cache$0.0105$9.45
有 cache(90% 命中)$0.0015$1.35
节省$8.10/月(86%)

Cache 对生产 agent 不是可选的。它是最大的单一成本压缩杠杆。

Anthropic 新的分级 cache(2026)

级别TTL写入成本读取成本适合
5 分钟 cache5 min1.25× input0.1× input对话式 agent(快速来回)
1 小时 cache60 min1.5× input0.1× input批量处理、定时 agent

对话 agent 每 30 秒一轮:5 分钟 cache 全覆盖。每日简报 agent:1 小时 cache 覆盖整个 session 但写入贵 20%。

真实费用公式

月费 = (input_tokens × input_price + output_tokens × output_price)
     × 每天调用次数 × 30
     × (1 - cache_命中率 × cache_节省比)

成本优化策略

策略 1:模型级联

便宜模型先分类,贵的只用在需要时:

输入 → 4o-mini(分类)→ 80% 解决 → 完($0.0003/次)
                      → 20% 复杂 → Sonnet 4($0.012/次)

混合成本:$0.0027/次
vs 全用 Sonnet:$0.012/次(贵 4.4 倍)

策略 2:Token 预算管理

显式设 max_tokens,不让模型废话:

设置典型输出费用影响
不限(模型自决)500-2,000 tokens不可预测
max_tokens: 500≤500封顶可预测
max_tokens: 100≤100(分类场景)输出成本最小化

策略 3:数据预过滤

社媒数据 API $0.001/次不管数据大小。LLM 按 token 计费。如果你把 30 条视频描述(每条 600 token = 18,000 token)全喂给 Sonnet 4:LLM 费 $0.054。如果先用数据 API 过滤到只有新/变化的 3-5 条:$0.009。

用便宜的数据 API 预过滤,再送贵的 LLM——这是最有效的成本优化。

更多按次 vs 按 token 的分析看 按次 vs 按 Token 选型

FAQ

哪个模型每百万 token 最便宜?

Gemini Flash 8B,$0.0375/M input。但「最便宜」不是正确问题——「满足准确率要求的最便宜」才是。先用你的实际 prompt 测准确率再优化成本。

1M context 真的每次调用花 1M token 的钱?

不是。Context window 是上限,你只为实际发送的 token 付费。1M 上下文模型处理 5,000 token 的 prompt 和 128K 模型处理同样 prompt 费用一样。

每天只跑一次的 agent,cache 有意义吗?

通常没有。Cache TTL 是 5-60 分钟。每日 agent 两次调用之间 cache 已过期。Cache 帮的是分钟内多次调用的 agent(对话、批量、快速工具调用)。

怎么预测月 LLM 账单?

跑一天 agent,数总 input/output tokens(大部分 SDK 在响应里暴露 usage)。乘:日 tokens × 单价 × 30。加 20% 余量覆盖重试和边界情况。

基于数据 API 的竞品监控每月只花 $0.90——加上 LLM 分析也不过 $1.20。详见 抖音竞品监控教程

要点

  • 真实费用是 单价 × token 数 × 频率 × 天数,不只是 $/M tokens
  • Cache 在生产 agent 里省 50-90%,不是可选项
  • 模型级联(便宜分类 → 贵的推理)压低混合成本 3-5×
  • LLM 之前先用数据 API 预过滤:10 次 $0.001 的调用能省下比换模型更多的钱
  • 先测准确率再优化成本。便宜模型给错答案的成本比贵模型贵得多