按次 vs 按 Token:Agent 怎么选

两种定价模式对比:什么时候 $0.001 一次的数据 API 比让 LLM 自己搜便宜 10 倍,以及怎么在一个 agent 里混用两者。

先说结论 — 按次计费($0.001/次固定价)和按 token 计费($X/百万 tokens)服务 agent 的不同需求。按次赢在数据拉取:固定成本、预算可预测、响应再大也不加钱。按 token 赢在推理:成本随复杂度缩放、cache 减少重复。大部分生产 agent 两种都用——最省的架构是先用按次 API 预过滤,再把精简后的数据送给按 token 的 LLM。

你的 agent 做两类 API 调用:数据调用(“给我这个信息”)和推理调用(“分析这个信息”)。这两件事的成本结构根本不同,混着用不思考就是 agent 变贵的原因。

两种模式,具体看

按次计费

每次 API 调用付固定价。响应 100 字节还是 100KB——同一个价。

成本 = 调用次数 × 单价

例子:

  • 抖音视频详情:$0.001/次(返回约 2KB JSON)
  • 小红书博主详情:$0.02/次(返回约 5KB JSON)
  • 微博热搜:$0.001/次(返回约 10KB JSON)

影响成本的是:调用次数。不是响应大小、不是数据复杂度。

按 token 计费

按处理的 token 数付费——输入(你发的)和输出(模型生成的)都算。

成本 = input_tokens × input 价 + output_tokens × output 价

例子:

  • GPT-4o:$2.50/M input + $10.00/M output
  • Claude Sonnet 4:$3.00/M input + $15.00/M output
  • GPT-4o-mini:$0.15/M input + $0.60/M output

影响成本的是:prompt 长度、上下文占用、回复长度、模型选择。

三个场景正面对决

场景 1:“给我当前热搜”

按次:调微博热搜 API

费用:1 × $0.001 = $0.001
耗时:1-3 秒
输出:50 个话题含热度分,结构化 JSON

按 token:问 LLM “微博现在热搜是什么”

费用:~500 input tokens × $3.00/M + ~1000 output × $15.00/M = $0.0165
耗时:2-5 秒
输出:模型没有实时数据,会幻觉或拒绝回答

赢家:按次。 LLM 没有实时数据访问权限,做不了这件事。即使能做,也贵 16 倍。数据拉取属于数据 API。

场景 2:“分析这 10 个竞品视频,告诉我趋势”

你已经用按次 API 花 $0.01 拉到了数据。现在需要分析。

这不是数据拉取问题——是推理问题。没有按次 API 能做”从视频元数据分析竞争策略”。

按 token:把 10 条视频记录(~3,000 tokens)+ 分析 prompt(~500 tokens)喂给 Claude Sonnet 4

费用:$0.0105 + $0.012 = $0.0225
输出:结构化竞品分析含可执行建议

赢家:按 token。 只有 LLM 能对非结构化数据做推理。

场景 3:“监控 10 个账号,变化时告警”

这是组合发力的地方。

全 LLM(贵)

每 15 分钟:把 10 个账号全部数据送 LLM 问"有新东西吗?"
费用:15,000 tokens × $3.00/M × 96 轮/天 = $4.32/天 = $129.60/月

按次 + LLM(便宜)

每 15 分钟:
1. 按次 API 拉数据($0.01)
2. 本地代码和上次快照做 diff(免费)
3. 如果有变化:只送变化部分给 LLM($0.02)
   否则:跳过 LLM(免费)

假设 20% 的周期有变化:
费用:$0.01 × 96 + $0.02 × 19 = $1.34/天 = $40.20/月

赢家:组合。 同样的分析质量,$40/月 vs $130/月。按次 API 做数据拉取,LLM 只在需要推理时启动。

成本对比表

同一个 agent 任务三种架构的费用:

架构数据费LLM 费月总计vs 全 LLM 省
全 LLM$0$129.60$129.60
全 API(无分析)$28.80$0$28.8078%(但没洞察)
API + 条件 LLM$28.80$11.40$40.2069%(洞察完整)

组合架构省 69% 且保持完整分析输出。省下来的核心洞察:本地 diff 能回答的问题不要送 LLM。

预算控制模式

模式 1:按 session 设 token 上限

MAX_TOKENS = 50000  # 单 session 封顶 ~$0.15(Sonnet 4)
used = 0
for turn in turns:
    if used + estimated > MAX_TOKENS:
        break
    resp = call_llm(...)
    used += resp.usage.total_tokens

模式 2:按天设调用次数上限

MAX_DAILY = 500  # 每天 $0.50 封顶
if daily_calls >= MAX_DAILY:
    raise BudgetExceeded("日数据 API 预算用完")

模式 3:成本感知的模型选择

def choose_model(complexity, remaining_budget):
    if remaining_budget < 0.01:
        return "openai/gpt-4o-mini"      # 最便宜
    elif complexity == "simple":
        return "openai/gpt-4o-mini"
    elif complexity == "moderate":
        return "anthropic/claude-sonnet-4"
    else:
        return "anthropic/claude-opus-4.7"  # 只给复杂推理

什么时候按次比 LLM 便宜 10 倍

规律:当 $0.001 的按次 API 能替代 3,000+ token 的 LLM prompt 时。

按次:$0.001
LLM 等价:3,000 tokens × $3.00/M = $0.009(仅 input)

按次便宜 9 倍,且给你 LLM 没有的实时数据。

这在什么时候发生?每当你问 LLM 去检索它 weights 里没有的事实数据时。LLM 要么幻觉(错误答案,坏决策的成本是无穷的)要么拒绝(浪费 token)。按次 API 用更少的钱给你真实数据。

规则

答案在结构化数据库里 → 按次 API
答案需要对数据做判断 → LLM
不确定 → 先拉数据,数据不够用再上 LLM

FAQ

什么时候只用按次 API(不需要 LLM)?

当 agent 的决策可以用简单规则在结构化数据上做出。比如”任何竞品掉粉 5% 就告警”——一个减法加阈值,不需要 LLM。数据 API 拿数字,Python 做数学。

什么时候只用 LLM(不需要按次 API)?

当 agent 的全部数据来自 context window 或训练数据,任务纯粹是推理。比如”根据这份产品规格写营销文案”——不需要外部数据。

Cache 能让按 token 和按次一样便宜吗?

重复问同一个问题时可以:第 2-100 次命中 cache 省 50-90%。但对变化的数据(热搜、视频指标),cache 帮不上——每次问题都不一样。按次 API 不存在 cache 因为它每次返回新鲜数据。

怎么算 agent 的混合成本?

月费 = (数据调用/天 × 单价 × 30) + (LLM 调用/天 × 平均 tokens × token 价 × 30)

跑一周数据再外推。大部分 agent 费用在 3-5 天后稳定。

各模型具体定价看 LLM 定价指南。视频生成定价看 视频成本指南。数据 API 看 社媒 API 指南

要点

  • 按次($0.001/次)在数据拉取上碾压按 token:固定成本、实时数据、响应再大不加钱
  • 按 token 在推理上不可避免,但只该在需要推理时启动
  • 最省的 agent 架构:按次 API 拉数据 → 本地代码过滤 → LLM 只对变化做推理
  • 这种组合比全 LLM 架构省 69%,分析质量一样
  • 预算控制放三层:session token 上限、日调用上限、成本感知的模型选择
  • 判断规则很简单:答案在数据库里就用 API,需要判断就用 LLM,不确定先拉数据