按次 vs 按 Token:Agent 怎么选
两种定价模式对比:什么时候 $0.001 一次的数据 API 比让 LLM 自己搜便宜 10 倍,以及怎么在一个 agent 里混用两者。
先说结论 — 按次计费($0.001/次固定价)和按 token 计费($X/百万 tokens)服务 agent 的不同需求。按次赢在数据拉取:固定成本、预算可预测、响应再大也不加钱。按 token 赢在推理:成本随复杂度缩放、cache 减少重复。大部分生产 agent 两种都用——最省的架构是先用按次 API 预过滤,再把精简后的数据送给按 token 的 LLM。
你的 agent 做两类 API 调用:数据调用(“给我这个信息”)和推理调用(“分析这个信息”)。这两件事的成本结构根本不同,混着用不思考就是 agent 变贵的原因。
两种模式,具体看
按次计费
每次 API 调用付固定价。响应 100 字节还是 100KB——同一个价。
成本 = 调用次数 × 单价
例子:
- 抖音视频详情:$0.001/次(返回约 2KB JSON)
- 小红书博主详情:$0.02/次(返回约 5KB JSON)
- 微博热搜:$0.001/次(返回约 10KB JSON)
影响成本的是:调用次数。不是响应大小、不是数据复杂度。
按 token 计费
按处理的 token 数付费——输入(你发的)和输出(模型生成的)都算。
成本 = input_tokens × input 价 + output_tokens × output 价
例子:
- GPT-4o:$2.50/M input + $10.00/M output
- Claude Sonnet 4:$3.00/M input + $15.00/M output
- GPT-4o-mini:$0.15/M input + $0.60/M output
影响成本的是:prompt 长度、上下文占用、回复长度、模型选择。
三个场景正面对决
场景 1:“给我当前热搜”
按次:调微博热搜 API
费用:1 × $0.001 = $0.001
耗时:1-3 秒
输出:50 个话题含热度分,结构化 JSON
按 token:问 LLM “微博现在热搜是什么”
费用:~500 input tokens × $3.00/M + ~1000 output × $15.00/M = $0.0165
耗时:2-5 秒
输出:模型没有实时数据,会幻觉或拒绝回答
赢家:按次。 LLM 没有实时数据访问权限,做不了这件事。即使能做,也贵 16 倍。数据拉取属于数据 API。
场景 2:“分析这 10 个竞品视频,告诉我趋势”
你已经用按次 API 花 $0.01 拉到了数据。现在需要分析。
这不是数据拉取问题——是推理问题。没有按次 API 能做”从视频元数据分析竞争策略”。
按 token:把 10 条视频记录(~3,000 tokens)+ 分析 prompt(~500 tokens)喂给 Claude Sonnet 4
费用:$0.0105 + $0.012 = $0.0225
输出:结构化竞品分析含可执行建议
赢家:按 token。 只有 LLM 能对非结构化数据做推理。
场景 3:“监控 10 个账号,变化时告警”
这是组合发力的地方。
全 LLM(贵):
每 15 分钟:把 10 个账号全部数据送 LLM 问"有新东西吗?"
费用:15,000 tokens × $3.00/M × 96 轮/天 = $4.32/天 = $129.60/月
按次 + LLM(便宜):
每 15 分钟:
1. 按次 API 拉数据($0.01)
2. 本地代码和上次快照做 diff(免费)
3. 如果有变化:只送变化部分给 LLM($0.02)
否则:跳过 LLM(免费)
假设 20% 的周期有变化:
费用:$0.01 × 96 + $0.02 × 19 = $1.34/天 = $40.20/月
赢家:组合。 同样的分析质量,$40/月 vs $130/月。按次 API 做数据拉取,LLM 只在需要推理时启动。
成本对比表
同一个 agent 任务三种架构的费用:
| 架构 | 数据费 | LLM 费 | 月总计 | vs 全 LLM 省 |
|---|---|---|---|---|
| 全 LLM | $0 | $129.60 | $129.60 | — |
| 全 API(无分析) | $28.80 | $0 | $28.80 | 78%(但没洞察) |
| API + 条件 LLM | $28.80 | $11.40 | $40.20 | 69%(洞察完整) |
组合架构省 69% 且保持完整分析输出。省下来的核心洞察:本地 diff 能回答的问题不要送 LLM。
预算控制模式
模式 1:按 session 设 token 上限
MAX_TOKENS = 50000 # 单 session 封顶 ~$0.15(Sonnet 4)
used = 0
for turn in turns:
if used + estimated > MAX_TOKENS:
break
resp = call_llm(...)
used += resp.usage.total_tokens
模式 2:按天设调用次数上限
MAX_DAILY = 500 # 每天 $0.50 封顶
if daily_calls >= MAX_DAILY:
raise BudgetExceeded("日数据 API 预算用完")
模式 3:成本感知的模型选择
def choose_model(complexity, remaining_budget):
if remaining_budget < 0.01:
return "openai/gpt-4o-mini" # 最便宜
elif complexity == "simple":
return "openai/gpt-4o-mini"
elif complexity == "moderate":
return "anthropic/claude-sonnet-4"
else:
return "anthropic/claude-opus-4.7" # 只给复杂推理
什么时候按次比 LLM 便宜 10 倍
规律:当 $0.001 的按次 API 能替代 3,000+ token 的 LLM prompt 时。
按次:$0.001
LLM 等价:3,000 tokens × $3.00/M = $0.009(仅 input)
按次便宜 9 倍,且给你 LLM 没有的实时数据。
这在什么时候发生?每当你问 LLM 去检索它 weights 里没有的事实数据时。LLM 要么幻觉(错误答案,坏决策的成本是无穷的)要么拒绝(浪费 token)。按次 API 用更少的钱给你真实数据。
规则
答案在结构化数据库里 → 按次 API
答案需要对数据做判断 → LLM
不确定 → 先拉数据,数据不够用再上 LLM
FAQ
什么时候只用按次 API(不需要 LLM)?
当 agent 的决策可以用简单规则在结构化数据上做出。比如”任何竞品掉粉 5% 就告警”——一个减法加阈值,不需要 LLM。数据 API 拿数字,Python 做数学。
什么时候只用 LLM(不需要按次 API)?
当 agent 的全部数据来自 context window 或训练数据,任务纯粹是推理。比如”根据这份产品规格写营销文案”——不需要外部数据。
Cache 能让按 token 和按次一样便宜吗?
重复问同一个问题时可以:第 2-100 次命中 cache 省 50-90%。但对变化的数据(热搜、视频指标),cache 帮不上——每次问题都不一样。按次 API 不存在 cache 因为它每次返回新鲜数据。
怎么算 agent 的混合成本?
月费 = (数据调用/天 × 单价 × 30) + (LLM 调用/天 × 平均 tokens × token 价 × 30)
跑一周数据再外推。大部分 agent 费用在 3-5 天后稳定。
各模型具体定价看 LLM 定价指南。视频生成定价看 视频成本指南。数据 API 看 社媒 API 指南。
要点
- 按次($0.001/次)在数据拉取上碾压按 token:固定成本、实时数据、响应再大不加钱
- 按 token 在推理上不可避免,但只该在需要推理时启动
- 最省的 agent 架构:按次 API 拉数据 → 本地代码过滤 → LLM 只对变化做推理
- 这种组合比全 LLM 架构省 69%,分析质量一样
- 预算控制放三层:session token 上限、日调用上限、成本感知的模型选择
- 判断规则很简单:答案在数据库里就用 API,需要判断就用 LLM,不确定先拉数据

