Claude Fable 5.1 更新了什么?编程、科研与缓存价格变化

SandBase 解读 Claude Fable 5.1 的编程表现、API 型号与缓存价格,用具体算例解释费用变化,并链接有真实账单的 Astra 同题实测。

Fable 5.1 与 Mythos 5.1 暗黑科技风封面,展示金星地形、蛋白质与 GPU 科研仪器

先说结论

Claude Fable 5.1 是 Anthropic 用于编写和修改代码、分析文档、调用工具完成多步骤工作的模型。如果你正在维护一个代码 Agent,想把现有模型换成它,先看两件事:原来的任务能否做完,做完一项要花多少钱。9 月 1 日的官方发布给出了性能提升与缓存读取降价,但不能概括成“所有任务便宜 75%”。

这篇 SandBase 评析把三类材料分开:官方评测、按单价计算的费用示例,以及另一篇 9 月 7 日 Astra 与 Fable 同题游戏实测。实测中有实际请求账单和启动失败;下文的科研成果仍是厂商披露,不是我们完成的实验。

  • Fable 5.1 已向 Claude 产品与 API 用户开放,官方 API ID 是 claude-fable-5-1
  • 输入、输出单价仍为每百万 Token 10、50 美元;缓存读取从 1 美元降至 0.25 美元。
  • Mythos 5.1 使用同一底层模型,但研究权限受审核限制,不是所有 Fable 用户都能切换的另一档模式。
  • 下文的基准与客户案例来自官方披露,不是本文独立复现;更换模型前仍要用自己的任务比较。

Fable 5.1 编程与知识工作:提升发生在哪里

官方的 Terminal-Bench-Science 0.1(科学软件终端任务)结果为 52.6%,同表 Fable 5 为 24.7%、GPT-5.6 Sol 为 22.4%。这是指定测试配置下的任务成绩,不能解释成完成任意科研问题的概率。

Terminal-Bench 4.0 衡量终端中的代码与工具任务:Fable 5.1 为 55.8%,Fable 5 为 42.0%,Mythos 5.1 为 60.9%。两款 5.1 使用相同底层模型,官方解释分差与护栏介入有关,不能据此推断 Mythos 参数更多。

Fable 5.1 与 Mythos 5.1 前沿基准测试可视化

图:GPT Image 2 根据 Anthropic 发布数据制作的信息图,不是官方原图。图形位置不代表精确比例,数值以标签与官方表格和脚注为准。百分比测试与 GDPval-AA 的分数使用不同单位。

知识工作评测 GDPval-AA v2 为 1853 分;Humanity’s Last Exam(跨学科高难推理)为带工具 65.0%、不带工具 60.9%。不要混用两种设置。官方还注明科学终端测试有约 ±3.5–4.5 个百分点的标准误,且 Fable 评测开启生产护栏,部分任务可能由 Opus 回退处理。

Fable 5.1 API 价格:哪些降了,哪些没变

缓存读取是重复使用已经处理并保存的输入,例如多轮任务中反复读取同一批背景文档。它和新输入、输出、缓存写入不是同一计费项,具体机制见缓存读取与写入费用说明

计费项Fable 5Fable 5.1
新输入,每百万 Token10 美元10 美元
输出,每百万 Token50 美元50 美元
缓存读取,每百万 Token1 美元0.25 美元

GPT Image 2 生成的 Fable 5.1 缓存读取价格报告图

图:按官方数据制作的价格示意图。75% 对应缓存读取单价;25% 和最高约 45% 对应官方特定工作负载的成本估算。

固定用量算一次:12 美元变成 11.25 美元,不是 3 美元

假设一次任务有 10 万新输入 Token、20 万输出 Token,以及从已有缓存读取的 100 万 Token。先固定用量,按官方单价计算:

纳入计算的用量Fable 5Fable 5.1
10 万新输入 Token1 美元1 美元
20 万输出 Token10 美元10 美元
100 万缓存读取 Token1 美元0.25 美元
小计12 美元11.25 美元

省下的是 0.75 美元,即这部分小计的 6.25%。这是算例,不是实测或完整账单:未计创建缓存、工具、税费及平台额外费用。实际 Token 数变了,结果也会变。按上述输出单价,多生成 2 万 Token 就会增加 1 美元,超过算例省下的缓存读取费。

官方约 25% 的普通负载节省、最高约 45% 的重度 Agent 节省,是另一套估算,依据为 2026 年 8 月四周实际用量和默认推理档位,不来自上面的假设,也不是每次调用的保证。

自己的账单该看哪些项

对同一道验收通过的任务,分别记录新输入、缓存写入、缓存读取、输出和重试用量。重复发送文档不等于一定命中计费缓存;服务提供缓存读取记录时,以记录为准。没有这项信息,就把节省金额标为未验证,不能把全部输入直接打成二五折。

调用 Fable 5.1,模型 ID 应该填哪个?

Anthropic 直连接口使用 claude-fable-5-1;9 月 9 日核对的 SandBase Claude Fable 5.1 模型页使用 anthropic/claude-fable-5.1。这是同一个 Anthropic 模型在不同服务中的调用名称;SandBase 提供 API 接入,不是 Fable 的研发厂商。

SandBase 模型页当时列出每百万 Token 输入 10 美元、输出 50 美元、缓存读取 0.25 美元。页面同时有 Messages API 详情与 Chat Completions 示例,接入时按选定接口使用参数,不能混用两套请求格式。本次更新核对了目录和参数说明,没有新增推理测试,也没有验证每个账户的权限。

单价相同,不代表上面的假设算例就是 SandBase 实付账单。想看实际请求费用,读 Astra 与 Fable 的 3D 游戏实测;想确认资格和数据留存,读 Fable 与 Mythos 访问对比。Fable 已列入目录,不能证明账户也有 Mythos 权限。

科研案例:地图、结合物与 GPU 计算要分别看

金星地形:更细的估计,不是新的实地观测

Fable 5.1 使用 NASA 麦哲伦号历史雷达图像及已有地图训练神经网络,生成覆盖约三分之一金星的新高程图。官方报告可辨识细节从 10–20 公里改善到 2–3 公里,高度估计准确性最高改善 25%。

麦哲伦雷达、旧高程测量与新 DEM 的金星火山对照

图:官方同区域对照包含麦哲伦雷达、旧高程数据和新 DEM(数字高程模型)。300 米是图中标注的网格尺度,不等于真实地形细节已经验证到 300 米。

蛋白质设计:实验命中不等于药物成功

Mythos 5.1 调用开源设计与折叠工具,候选交由两家外部机构验证。官方报告在 12 个靶点上总体命中率接近 50%,其中三个靶点的结合亲和力超过所比较竞赛最佳设计约 10 倍。这里的命中指有效结合物,不代表药效、毒性或临床试验已经过关。

Anthropic 发布页中的 Nipah G 蛋白质结合物设计

图:官方 Nipah G 结合物示例标注 18/30(60%)。这一示例的样本分母不能代替正文中覆盖 12 个靶点的总体命中率。

GPU Kernel:最高加速与整项分析费用不同

GPU Kernel 是在显卡上执行计算的小程序。Mythos 5.1 为七个开源模型修改这类程序并缓存中间结果,官方在 H100 上报告约 1.4–2.5 倍加速,同时检查输出一致性。Evo 2 40B 扫描 300 万个变异的示例,按云端标价估算费用从 1.8 万美元降至 8 千美元;不是所有模型都获得 2.5 倍速度,也不是本文实付账单。

GPT Image 2 生成的 Mythos 5.1 GPU Kernel 模型数量、速度与成本报告图

图:按官方案例制作的示意图。2.5 倍是最高测试值,1.8 万美元到 8 千美元是指定分析的 GPU 费用估算。

科研方法与验证限制详见金星制图、蛋白质设计与 GPU 加速案例拆解

长程编码:看测试记录,不只看最终演示

官方表中 CursorBench 3.2.0 为 73.4%,AutomationBench 为 31.4%,后者的 Fable 5 基线为 17.1%,因此准确说法是明显提升,而不是严格翻倍。

Millennium 的客户证言描述了一次约百万次运行才出现一次的崩溃,四到五年未找到原因。Fable 5.1 反汇编外部供应商库并与崩溃转储对照,定位了问题。这个案例说明值得测试跨依赖排错能力,但没有提供你的仓库必定成功的承诺。

GPT Image 2 生成的 Fable 5.1 与 Mythos 5.1 长程编码基准报告图

图:根据官方结果制作的三项指标示意。60.9% 对应 Mythos 5.1 的 Terminal-Bench 4.0;另外两项对应 Fable 5.1。

建筑漫游视频可以展示空间和材质的一致性,却不能证明任意建筑方案能建造,或模型一定一次完成。实际迁移应同时保存提示词、工具权限、补丁、失败测试和返工记录。

视频:住宅方案的室内外漫游,展示房间、庭院、材质与自然光的衔接。画面不是建筑工程验收结果。

安全与访问:拒答更少,不代表没有限制

官方报告,相比 Fable 5 之前的护栏,Claude Code 每次会话的网络安全护栏介入平均减少约 60%,并允许源代码漏洞识别。这不是对所有 API 应用都测得的 60% 降幅。渗透测试、利用生成和二进制扫描等请求仍可能触发拦截或回退。不能把“找到漏洞”推导成“获得攻击授权”。

Mythos 的生命科学验证计划是邀请制测试;网络安全验证计划公告说明 Mythos 将后续加入。Claude Security 已使用 Mythos 5.1,但这不等于任意 API 用户都能调用。具体申请与留存条款见Fable 5.1 和 Mythos 5.1 的访问区别

反蒸馏机制也影响自定义客户端。发布公告说明,新账号不能在保留先前思考记录的同时任意编辑其对应的历史上下文;既有账号暂不受该次调整影响,未来模型会扩大适用范围。它限制的是一种提取模型能力的用法,不意味着所有多轮对话都不能编辑。

常见问题

Fable 5.1 的 API 模型 ID 和价格是什么?

官方 ID 为 claude-fable-5-1,输入、输出分别为 10、50 美元/百万 Token,缓存读取为 0.25 美元/百万 Token。第三方平台可能使用不同路由名与价格,调用前单独核对。

75% 降价适用于 ChatGPT 或 Claude 订阅费吗?

不适用。这里说的是 Fable 5.1 按 Token 计费的缓存读取单价,不是订阅费,也不是全部任务费用。

任务没有命中缓存,还能享受这次降价吗?

仅就缓存读取这项降价而言,不能。新版本可能改变完成任务所需的步骤和 Token 数,但必须用同题测试判断,不能从“75%”直接推导。

Fable 和 Mythos 的分数为什么不一样?

它们共享底层模型,但护栏和回退会影响部分评测任务。必须一起看模型版本、测试设置与安全脚注。

能否用公开 Fable API 复现 Mythos 的所有科研案例?

不能这样保证。Mythos 的研究访问有额外审核,案例还依赖领域工具、数据和外部实验,不是换一个模型名就能复制。

迁移前先选一道真实任务

保留当前模型作为对照,跑一次过去确实让团队返工的任务,比较验收结果和总费用。需要具体例子,可看同题 Astra / Fable 实测Fable 长任务验收步骤。决定是否迁移的应是这些结果,而不是单独一个“75%”。

来源(2026 年 9 月 9 日核对):Anthropic 正式发布页Fable 产品页Mythos 产品页SandBase Fable 5.1 模型页。本文初次发布于 9 月 2 日;本次补充调用型号与价格说明,区分官方评测和站内独立实测,没有新增跑分。