Gemini 3.8 Flash 低成本编程:补丁失败后,再试两轮划算吗?
算清 Gemini 3.8 Flash 编程费用:区分官方与渠道单价,把思考 Token、失败重试和测试开销计入一份合格补丁,附最多两轮重试示例。
代码 Agent 交出补丁,回归测试却还在报错。继续用 Gemini 3.8 Flash 再试一次,还是立刻换更强的模型?该比较的是拿到一份合格补丁花了多少钱,而不是一次调用的单价。思考 Token、失败的尝试和运行测试,都要算进账单。
Gemini 3.8 Flash 发布时的几组数字解释了这个问题为什么值得讨论:输入 $0.75、输出 $3.75/百万 Token 的年内优惠价,73.7% 的 DeepSWE v1.1 成绩,以及第三方测得的接近 300 tokens/s 输出速度。本文仍然比较“一次深入调查”和“多次便宜尝试”,但只讨论一个具体用法:修复可复现的代码错误,首次尝试失败后,最多再给两轮机会。
先说结论
- Gemini 3.8 Flash 的关键价值不是“便宜版旗舰”,而是低价和高吞吐让并行候选、快速重试与持续验证变得可行。
- Google 公布的 DeepSWE 73.7% 说明它能处理长仓库任务,但该结果使用特定脚手架和 high thinking 设置,不能直接宣布它“全面登顶”。
- 多试几轮并不会自动变聪明;只有单元测试、Schema、权限规则等独立验证器能可靠判错时,这种策略才成立。
- Fable 5.1 更适合作为高风险或原因模糊任务的升级通道,两者可以出现在同一个模型路由中。
Google 官方性能面板把 73.7% 的 DeepSWE v1.1 结果与单任务平均成本放在同一张图中;不同模型的评测配置仍需结合方法说明解读。
Gemini 3.8 Flash 真正卖的不是“快”,而是下一次尝试
Google 在 9 月 2 日 UTC——北京时间 9 月 3 日——发布 Gemini 3.8 Flash。Gemini 3.8 Flash 模型页面显示,模型已经 GA(正式可用),输入窗口为 100 万 Token,最大输出 64K,并允许开发者调整推理档位。年内优惠价是输入 $0.75、输出 $3.75/百万 Token。单看价格,它并不只是比前沿旗舰便宜一点,而是把一次代码尝试压到了可以被频繁调用的区间。
Google 官方产品页将 Gemini 3.8 Flash 定位为面向编程与 Agent 工作的模型。
这会直接改变 Agent 的行为。过去一次调用很贵,系统往往只能让模型生成一个补丁,然后寄希望于它足够正确。现在,同一笔预算可以让 Gemini 先给出两个候选修复,分别运行测试;如果都失败,再根据两份错误日志重跑。速度也在这里发挥作用:当一轮输出接近 300 tokens/s,多一次尝试不再意味着漫长等待。
单价当然不是完整账单。输出长度、high thinking 带来的额外 Token、工具调用、失败重试和最终成功率都会影响成本。低价的意义不是“无论怎么跑都便宜”,而是允许系统把预算从单次押注改成一组有上限的实验。这个区别很重要:Gemini 3.8 Flash 的工程价值,更多出现在 Agent loop 里,而不是聊天框里。
73.7% 的 DeepSWE,证明了什么,又没有证明什么
Google 在模型页面公布 Gemini 3.8 Flash 在 DeepSWE v1.1 上取得 73.7%。DeepSWE 面向长周期软件工程任务,模型不只回答一道题,还要进入代码仓库、理解上下文、修改文件并接受测试。因此,这个结果至少说明 Flash 不再只是负责分类、抽取和补全的便宜模型;在特定配置下,它能把长任务跑到终点。
但“73.7%”不能脱离评测方法单独传播。Google 的方法文档写明,Gemini 结果由 Google 使用 mini-swe-agent 脚手架、在 high thinking 档位下计算;同一张表里的其他模型数值,可能来自公开榜单,也可能来自厂商自报。任务、脚手架、推理设置和结果来源没有完全统一,所以它不是一次严格控制变量的正面对决。
这也是为什么不能把 DeepSWE 73.7%、Fable 的 CursorBench 73.4% 和 Terminal-Bench 分数排成一张“总榜”。数字看起来接近,考试内容却不同。更稳妥的解读是:Gemini 3.8 Flash 已经进入长任务候选名单,而且它的速度和价格使大规模内部复测变得更现实。至于是否真的适合某个仓库,仍要固定 Prompt、权限、代码 commit、超时和验收条件,在相同脚手架里重跑。
两段演示视频把这种产品方向表现得更直观。DOS 风格地图和循环指令游戏都不只是代码片段,而是可运行、可交互并带测试信息的成品。它们不是标准评测,没有对照组、重复次数和独立验收报告,不能用来证明稳定性;但它们清楚展示了 Google 想让 Flash 承担的工作单位:生成、执行、检查,再继续修改。
DOS 风格地图演示同时展示了生成代码、可交互成品和 27 项自动化测试摘要。
循环指令游戏展示了更大的交互成品,但无法因此判断代码可维护性、重跑一致性和隐藏失败率。
速度和价格怎样变成 Agent 的系统能力
Artificial Analysis 在 9 月 3 日的数据截面,给了 Gemini 这条路线一个更清楚的坐标。Gemini 3.8 Flash 在 high 设置下,综合指数为 59,输出速度约 299 tokens/s,每个指数评测任务成本 $0.58。Fable 5.1 在 max with fallback 设置下,综合指数为 66,输出速度约 66 tokens/s,每任务 $3.69。

GPT Image 2 可视化:同日数据中,Gemini 采用 high 设置,Fable 采用 max with fallback;综合指数混合九项评测,每任务成本只对应该机构的评测负载。点位仅作示意,准确数值以数字标签及上方数据表为准。
Fable 的综合分高 7 分,Gemini 的输出速度却超过四倍,评测任务成本只有前者的约六分之一。这不是在宣布 Gemini 比 Fable 更聪明,而是在说明它可以买到更多尝试次数。假设一个任务只有一份主观答案,那么多跑几次意义有限;如果任务有明确的单元测试、返回 Schema、编译器错误或数值校验,同样的预算就可以同时探索多个候选,再让确定性规则淘汰失败者。
这里最容易出现的误判,是把“便宜模型多跑几次”等同于“正确率自然提高”。如果模型自己负责生成答案,又自己宣布哪个答案最好,多轮尝试只会制造更多貌似合理的结果。真正把速度变成工程智力的是外部验证器:测试是否通过、JSON 是否符合 Schema、权限是否越界、结果能否复算。没有这些条件,299 tokens/s 只意味着错误也能更快地产生。
重试还必须有上限。两个候选用不同方式失败、连续几轮无法收敛,或需求本身无法写成通过条件时,继续调用同一个模型通常是在烧钱。这时系统应该升级到更强的模型或人工检查,而不是把低单价当成无限循环的理由。
Gemini 3.8 Flash 编程费用:一份合格补丁怎么算钱
截至 2026 年 9 月 8 日,Google API 价格表的 Standard 档写明:2026 年 12 月 31 日前,输入 $0.75、输出 $3.75/百万 Token;输出价格包含思考 Token。2027 年 1 月 1 日起列出的价格是 $1.50/$7.50。思考文档也明确,计费看实际生成的思考 Token,不是界面里那一小段思考摘要。
下面是假设算例,不是实际编程测试账单。每次尝试输入 20,000 Token,计费输出共 8,000 Token(含思考);没有缓存命中和搜索附加费,重试用量暂按相同计算。
| 最多尝试多少次 | 累计输入 / 计费输出 Token | Google Standard 年内模型费 | SandBase 页面所列模型费 |
|---|---|---|---|
| 首次尝试 | 20,000 / 8,000 | $0.045 | $0.090 |
| 首次 + 1 次重试 | 40,000 / 16,000 | $0.090 | $0.180 |
| 首次 + 2 次重试 | 60,000 / 24,000 | $0.135 | $0.270 |
第一行的官方价算法是:20,000 ÷ 1,000,000 × $0.75 + 8,000 ÷ 1,000,000 × $3.75 = $0.045。假如可见答案占 2,000 Token、思考占 6,000,计费输出就是 8,000,不能只算 2,000,也不能重复相加变成 14,000。
SandBase 的 Gemini 3.8 Flash 专页在 9 月 8 日列出的是输入 $1.50、输出 $7.50/百万 Token,所以表中单独计算,不能套用 Google 的年内优惠。页面也列出了模型 ID google/gemini-3.8-flash 和 Chat Completions 接口;这里核验的是产品页面与文档,不是已经完成一次 API 实测,也不代表官方优惠适用于该渠道。
再加上验收开销:假设每次隔离测试花 $0.02,官方价下跑完三次就是 $0.195,还没算人工审查。若三次都失败,得到的合格补丁仍然是零。批量评估时,用含失败任务在内的全部模型费和测试费,除以实际验收通过的补丁数。人工审查另记分钟数,或注明时薪后换算。上下文越滚越长、CI 越跑越慢,都可能吃掉低单价的优势。
Flash Cyber 的受限安全测试不能证明这份普通编程账单。它的资格与数据放在三模型对比文章中,不在这里展开。
Fable 5.1 为什么仍然是必要的对照
Anthropic 发布页中,Millennium 的客户证言描述了沿罕见崩溃追进第三方二进制库的调查。它不是独立复现的测试,但能说明什么情况下不该多试补丁:错误难以复现、还不知道怎么验收时,先找到可验证的原因,比再生成一个改动更重要。
Fable 仍可用于原因不明的复杂调查。下图中的评测任务与 DeepSWE 不同,不能据此算出“几次 Gemini 等于一次 Fable”。
Anthropic 发布页汇总了 Fable 5.1 与 Mythos 5.1 在科研、编程、知识工作和商业工作流评测中的结果。
Fable 的 API 单价、缓存写入价,以及“缓存读取降价不等于整单同幅降价”的区别,见 Fable 价格说明。未缓存单价更高,恰恰意味着要比较合格结果的成本,而不是先替所有难题指定一个模型。
首次补丁失败后,最多再给两轮
先拿一个小而可回滚的修改演练,不要从生产事故开始。下面是操作示例,假设仓库已有日期解析函数和测试命令;文件路径、命令要换成你自己的,不是可直接调用的通用配置。
可以这样下达任务:
修改
src/date-parser.ts,让无效日期返回错误,而不是自动进位。只在tests/date-parser.test.ts补三个用例:2026-02-29 应失败、2028-02-29 应成功、空字符串应失败。保留公开返回类型,不改依赖和生产配置。运行现有日期解析测试,再运行正常回归测试。首次失败后最多再试两轮;不发布、不部署。
开始前记下代码 commit、测试命令、预期结果和模型费用上限。在没有生产凭据的隔离副本中执行。这里的“一轮”指一次补丁尝试,不是每读取一个文件就算一次。
| 阶段 | 给 Agent 的材料 | 何时通过,何时停 |
|---|---|---|
| 首次尝试 | 任务、相关文件、固定测试 | 专项测试与回归通过,再审 diff |
| 第 1 次重试 | 失败测试名、实际值与预期值、当前 diff | 只针对这次错误修复,不允许削弱测试 |
| 第 2 次重试 | 新错误日志、上一轮无效修改 | 再失败、超预算或重复同一解释,就停止 |
| 升级处理 | 原任务、三次 diff、日志、Token 合计 | 交给人工或深入调查,不自动合并 |
如果 Agent 删掉报错的断言才让测试变绿,仍然算失败。如果改日期解析却引起登录回归,应提前停止;“最多两轮”不是必须用满。陌生仓库的测试脚本本身也能执行代码,先检查实际命令并放进隔离环境,不要默认“跑测试就无风险”。
累计记录一批任务的通过数、拒绝数、尝试次数、计费 Token、测试费用和审查分钟数,再让现有模型在相同 commit、相同测试下做对照。三次尝试预算不等于成功率承诺。至于升级给哪种模型,交给三模型路由对比讨论;这里先回答“再买一次便宜尝试值不值”。
Gemini 3.8 Flash 改写的不是榜单,而是预算分配
Gemini 3.8 Flash 最值得关注的地方,不是它能否在某张表上压过所有旗舰,而是它把“再试一次”的价格和等待时间都压了下来。代码 Agent 因此可以从单次生成转向多候选、自动验证和有限重试。Google 所说的 long-running agentic loops,也不再只依赖一次超长推理,而可以由许多快速、可检查的步骤组成。
这条路线有清楚的边界。能被客观判错、能够安全回滚的步骤,最适合让 Gemini 用低成本换取更多尝试;需求模糊、证据分散、错误后果严重的任务,则应该尽早升级。Fable 的意义在于标出 Gemini 路线的边缘:当验证器失效、重试不再提供新信息时,系统需要的就不是更快的下一轮,而是一次更深的调查。
延伸阅读:Agent 脚手架如何改变模型跑分,以及 Fable 5.1 的科研与缓存数据。正式接入前,在 Gemini 3.8 Flash 模型专页核对路由和渠道价格;算账时以你实际调用的提供方为准。
FAQ
Gemini 3.8 Flash 为什么适合代码 Agent?
因为它把较强的长任务成绩、接近 300 tokens/s 的第三方实测速率和较低单价放在了同一个模型里。Agent 因而可以在受控预算内生成候选、运行测试并快速重试。
DeepSWE 73.7% 能说明 Gemini 3.8 Flash 已经登顶吗?
不能直接这么说。Google 的结果使用 mini-swe-agent 和 high thinking 设置,表内其他模型的分数来源也不完全相同。它能证明 Gemini 在该配置下具备很强的长仓库任务能力,不能替代同条件的内部复测。
多跑几次 Gemini 能代替更强的模型吗?
只有当独立验证器能识别正确结果时才可能。单元测试、Schema、确定性计算和权限规则适合这种做法;模糊需求和复杂事故调查不适合靠重复调用碰运气。
Gemini 编程费用要算思考 Token 吗?
要。Google 的输出价包含思考 Token。上面 $0.045 的假设算例计算的是 8,000 个计费输出 Token,不只是可见补丁。不同渠道也可能不同价:SandBase 专页当前所列价格与 Google 的 2026 年 Standard 优惠价不同。
什么情况下应该从 Gemini 升级到 Fable 5.1?
当快速通道达到重试上限、不同候选以不同方式失败、任务无法写出可靠验收条件,或一次错误会触及资金、权限与不可逆操作时,就该换成长时间调查或人工介入。


