GPT-6 Astra vs Claude Fable 5.1 对比实测:同一道 3D 游戏题,表现差在哪?
SandBase 的 GPT-6 Astra vs Claude Fable 5.1 实测:用同一道 3D 游戏题,比较原始代码、启动失败、通关检查、返回耗时与实际 API 账单。
在 SandBase 9 月 7 日的实测中,GPT-6 Astra 与 Claude Fable 5.1 拿到同一道 3D 游戏题。对准备比较生成代码的开发者来说,问题很具体:第一次返回的文件能否启动、遵守关卡规则,并在不修代码的情况下通关?
为了比较这两个模型,我设计了一道相同的测试题:生成一款能在浏览器里运行的 3D 解谜游戏。除了看生成的画面,我还会检查角色能否移动、机关能否触发,以及能不能完成通关。
这次测试,Astra 的表现更好:三次生成都能通关,返回更快,请求费用也更低。最明显的代码问题出现在 Fable 第一次生成时——创建灯光的一处错误,让游戏在启动阶段就停了下来。
先说结论
- Astra 三次生成均通过 15 项功能检查,并完成按键通关与重置。
- Fable 最初三次请求,一次通过、一次启动失败、一次未收到代码;另一次补测通过。
- 收到完整代码的请求中,Astra 用时约 151—195 秒,Fable 约 253—294 秒。
- 按本次 SandBase API 账单,各自三次收到完整代码的请求平均约为 0.42 美元和 1.21 美元,Astra 更低;这不是官方直连价格。
测试题:三间密室,两道门
这道题叫 Aster Vault:三间相连的房间,两道门。玩家先恢复 Relay 供电,再激活 Orbital 装置,最后取得 Aster Core 星核。用 WASD 移动、鼠标转向、E 互动,通关后按 R 重来。
题目不大,但前后条件不能写散。没有供电,第二个机关不能生效;第二个机关没完成,就不能拿到星核。门关闭时必须挡人,打开后必须允许通过。重置也不能只清掉一句“胜利”,还得把玩家位置、门和机关一起恢复。
两款模型拿到相同需求,使用 Three.js——一个在浏览器中绘制 3D 场景的 JavaScript 库——生成单个 HTML 文件。整个比较只看第一次返回的代码,不追加修复。这样,一份漂亮但启动不了的答案,不会在修改之后被算成一次成功。
Astra 三次都能通关
Astra 的三份代码都正常启动,供电、开门、第二机关、星核和重置依次完成。第一份游戏恢复供电后,第一道门打开,屏幕上的目标随之切换到第二间房。
第一道门已经打开,当前目标切换为第二间房的 Orbital 装置。
这几个动作看似普通,却说明画面提示和游戏规则在这一处保持了一致:不是文字宣布门开了,碰撞还留在原地;也不是机关亮了,任务仍停在上一阶段。其余两份 Astra 代码也走完了同样的检查。
三次独立生成都走完这段流程,是 Astra 在本题中最直接的优势:同一份需求重复提交,三份返回代码都不需要修改就能使用。
Fable 首次运行报错
Fable 第一份代码的问题,比关卡设计更基础:创建点光源时,程序试图整体替换一个只读的位置属性,浏览器随即报错:
Cannot assign to read only property 'position' of object '#<PointLight>'
具体来说,它用 Object.assign 给光源重新赋了一个 position。在这里应当修改现有位置向量的坐标,而不是替换属性本身。错误发生在初始化阶段,后面的玩法还没机会运行。
这处错误直接决定了第一次生成的结果:浏览器无法完成初始化,房间、机关和胜利条件都无法接受后续检查。对一次生成测试来说,启动本身就是必须通过的第一关。
Fable 第三次生成的版本则是另一种结果。暖色的供电室后方能看到蓝色房间;恢复供电后,Relay 指示灯点亮、任务文字更新,第一道门打开。它和补测版本都没有改过源码。
Relay 已点亮,Orbital 和 Core 仍未完成。
Fable 最初三次请求的结果为一次通过、一次初始化失败、一次未取得代码;补测单独记录为通过。
机关、碰撞和重置
能进入场景,还不等于能通关。五份正常启动的游戏,既接受了 15 项功能检查,也用键盘输入从起点走到终点:走近机关、按 E、穿过门、收集星核,最后按 R 重置。
检查结果可以分成三个部分。机关顺序上,供电前不能激活第二装置,第二装置完成前不能取得星核;碰撞上,两道门关闭时阻挡角色,开启后可以穿过;重置上,通关后按 R,玩家位置和机关状态恢复。五份能启动的代码均通过这些检查。
Fable 补测原文件在未改代码的情况下到达通关界面。
按完整任务计算,Astra 三份代码全部通过,Fable 三份取得代码的版本中两份通过、一份在启动阶段失败,其中一份通过来自补测。具体差距是首次生成的完成情况;对已运行版本的功能检查,没有测出额外的玩法差异。
生成耗时与 API 费用
拿到完整代码的请求中,Astra 用时约 151—195 秒,Fable 约 253—294 秒。这是本次接口请求的等待时间,包含服务端处理和传输,并不能直接换算成模型的推理速度。
费用来自 SandBase API 的实际账单:Astra 平均约 0.42 美元,Fable 约 1.21 美元,后者约为前者的 2.91 倍。两边都按三次收到完整代码的请求计算,Fable 启动失败的那份也计入其中。
也就是说,这次并不是花更多钱、等更久的一方交出了更好的首次生成结果。Astra 在三项观察上同时领先:三次全部完成、返回时间更短、平均请求费用更低。
这轮实测,Astra 胜出
这道 3D 游戏题给出的答案是 Astra:三次原始代码全部通过,约两分半到三分多钟返回,平均每次 SandBase API 费用约 0.42 美元。
Fable 的启动错误则暴露了一个具体短板:一次错误的库调用,就让整份生成代码无法使用。它返回完整代码的请求等待更久,平均费用约 1.21 美元。在本次一次生成的比较中,Astra 用更少的时间和费用完成了更多成功尝试。
测试说明与逐次记录
测试于 2026 年 9 月 7 日通过 SandBase API 进行,路由为 openai/gpt-6-astra 和 anthropic/claude-fable-5.1。系统消息、用户需求和 40,000 token 输出上限一致;推理档位、温度、随机种子未指定,采用各接口默认值,不代表内部算力相同。运行环境为同一台机器的 Chrome,Three.js 0.180.0。
功能检查使用约定的测试接口检查状态、机关和碰撞;另一次按键通关不调用传送、开门或通关方法,只读取坐标与状态。原始游戏源码未修改。按键路线依据源码中的机关位置安排;Fable 第三份的初始路线撞上第二间房中央装置,改为绕行后通过,未修改游戏代码。
对应产品入口是 GPT-6 Astra 与 Claude Fable 5.1,已于 2026 年 9 月 8 日核对。新测试前确认模型 ID、所选接口的请求格式与现价。模型入口不包含本文使用的浏览器、游戏文件和功能检查器。
本轮通过 API 调用模型,并非在 Cursor 内测试。如果你打算在 Cursor 中使用它们,先看 OpenAI 接入限制与 BYOK 的区别;API 能调用,不代表编辑器提供同样的模型与工具。
想做一轮可比较的新实验,可以按下面记录:
- 保存一份系统消息和完整 Aster Vault 需求,写入上面的操作与关卡顺序,两边原样使用。本文的任务摘要并非原始请求全文;重新编写的提示词属于新实验,不是严格重放历史测试。
- 按所选接口文档,用对应字段设定 40,000 token 输出上限;推理档位、温度、随机种子仍不指定,记录接口与实际默认值。默认值可能更新,不要混用 Responses、Messages 和 Chat Completions 的参数。
- 首次回答先存档,再在相同 Chrome 环境和 Three.js 版本下检查启动、机关顺序、关门碰撞与重置,不要修完代码再评分。
- 同时记录接收超时、未收到代码、耗时和全部费用;补测单列,不能拿后来的成功覆盖原先的超时。
这是新一轮比较的操作说明,不是本次更新又做了实测。模型页可见,也不代表已经验证某个账户的调用资格,更不保证得到历史结果。
| 请求 | 返回耗时 | SandBase API 费用 | 结果 |
|---|---|---|---|
| Astra 1 | 151 秒 | $0.37330 | 功能检查、按键通关及重置通过 |
| Astra 2 | 189 秒 | $0.45315 | 同上 |
| Astra 3 | 195 秒 | $0.42480 | 同上 |
| Fable 1 | 253 秒 | $1.14862 | 初始化失败 |
| Fable 2 | 约 300 秒接收超时 | $1.41582 | 未取得代码,质量未知 |
| Fable 3 | 294 秒 | $1.28817 | 功能检查、按键通关及重置通过 |
| Fable 4,补测 | 272 秒 | $1.19942 | 同上 |
补测仅将接收等待上限从 300 秒延长至 600 秒,提示词和模型参数不变。Astra 三份代码的请求费用合计 $1.25125,Fable 三份合计 $3.63621;另有一笔 Astra 请求因采集会话中断未保存代码,费用 $0.41080,未评分。连同 Fable 超时请求,本轮总支出 $6.71408,不含此前测试费用。
如果你更关心日常使用能撑多久,可以接着看 GPT-6 Astra 的 Plus 使用限制与 API 实际费用,其中区分了单次生成账单与订阅额度。
生成一款 3D 游戏,和自己在三维环境中规划行动,是不同的能力。Astra 多模态与空间推理实测结合 MazeBench 的 14% 成绩、参数化建模与可视化案例,进一步拆解这种区别。
Fable 官方评测、缓存读取价格和调用型号,可继续读 Claude Fable 5.1 介绍。本轮只测试首次回答,没有检查 Agent 能否读取报错再修好游戏;后一个问题需要另做Fable 长任务验收,不能拿这里的一次启动失败代替结论。
FAQ
这是两个模型完整编程能力的排名吗?
不是。这里只有一道小型游戏题,比较的是一次生成,没有测试读取报错、修改代码再运行的多轮能力。Fable 的补测也单独列出,没有替换最初那次未知结果。
“可玩”是否代表画面更好、游戏更有趣?
这里的可玩指规定的操作和关卡可以完成。没有做画面盲评、稳定帧率测试或玩家体验调查,也没有覆盖手机、其他浏览器和大型场景。
文中的费用是官方价格吗?
不是,是此次 SandBase API 请求的账单金额。平均费用包含启动失败的代码,但不包含未收到代码的两次请求;这两笔费用保留在测试说明的总支出中。
2026 年 9 月 9 日更新:明确测试由 SandBase 进行,补充 Fable 价格说明与长任务评估链接。实验日期、原始输出、账单和评分均未改动,本次没有重新跑测试。


