GPT-6 Astra 多模态实测:3D 迷宫、建模与空间推理表现
MazeBench 14% 的纪录,与 Fusion 360 建模、频谱识别、分子演示和 48 关游戏放在一起看:GPT-6 Astra 已能做什么,哪些结论还不能下。
一边是迷宫里只拿到 14 分,另一边是看完一段浴室视频,就帮人设计出能装上的 3D 打印零件。GPT-6 Astra 的这两种表现,出现在同一批开发者实测中。
比起再列一遍发布会跑分,这组案例更适合回答一个实际问题:准备把 Astra 接入建模、可视化或电脑操作任务的开发者,究竟能把哪一步交给它?
先说结论:
- MazeBench 公布的 Astra 成绩是 14%,对应关闭 Python 的 ASCII 输入配置,不是直接观看 3D 视频的成绩。
- 开发者报告了从测量视频到 Fusion 360 参数化模型、再到零件试装的完整案例,但人仍参与了测量、确认和打印。
- 频谱猜音、分子演示和 48 关游戏各有看点,不能合并成一个“已经掌握物理世界”的结论。
以下依据截至 2026 年 9 月 8 日的基准记录与作者原帖整理,不是本站独立复测。中文 X 截图使用中文机器翻译,帖内模型输出及图表保留原貌;点击图片可查看原尺寸。
一、3D 空间推理突破:MazeBench 上的探索与偏科
MazeBench 由 Jonathan Pappas 和 David Pappas 在 7 月底公开。它有 200 多个房间、100 颗计分宝石,还包含推箱子谜题、电梯砖、可开关的墙和打滑的冰面。
模型通过 MCP(让模型调用外部工具的协议)使用 11 个基础动作:4 个移动、4 个视角转换,以及撤销、重置、传送。相机有 20 个观察角度,一道谜题可能需要规划 100 步以上。走到宝石旁边不算结束,还得弄清哪一块箱子先推、哪个机关会挡住回程。
这里要区分环境和输入:世界本身是三维的,但 Astra 这次在公开排行榜记录中属于 ASCII、无额外工具组,使用字符表示场景,Python 被关闭。它考验空间状态理解和行动规划,不能直接当成视频视觉识别成绩。
14% 登顶,但远没有走完整张地图
测试团队公布,Astra 花了 60 多个小时,最终计入排行榜的成绩为 14%。此前公布的无 Python 成绩不超过 1%;这次对比图中,Fable 5.1 为 2%。使用 Python 编写求解程序的旧成绩属于另一种配置,不能和这里直接排在一起比较。
MazeBench 公布 Astra 的 14% 成绩。(中文机器翻译)原帖。
热力图里,Astra 的探索范围明显大于 Fable 5.1。不过“范围更大”不是“遍历全图”:截至 9 月 7 日的暂停快照,记录为访问 256 个房间中的 103 个,计分宝石为 14 颗。记录还注明,运行期间引擎和关卡有过修改,统计包含回滚前的尝试,另有一颗宝石被排除计分。这是一份带过程说明的长任务记录,不是固定条件下多次运行的平均成功率。
Fable 5.1 与 Astra 的探索轨迹;颜色覆盖范围不等于已解开的谜题数量。来源:测试团队原图。
“批量出招”省了什么?
测试团队把“一步一回复”改为一次输出 10—20 步动作,并报告 token 消耗从约 30 亿降到 3.5 亿。按这两个近似数计算,降幅约 88%。token 是模型处理和生成文本的计量单位,不直接等于费用。
同一条帖子里的“便宜 3 倍、思考时间增加 60%”,说的是 Klotski 滑块谜题的那次比较。不能把这组成本和时间变化套到整场迷宫测试上。少往返能减少重复上下文,但动作一次发得更多,也减少了中途根据新情况调整的机会。
空间理解的短板同样具体。作者观察到,Astra 偏爱俯视角,容易忽略只能从某些角度看到的墙,把碰壁当成遇到了“隐形障碍”。超过三层高的堆叠谜题,也明显增加了困难。它更会探索了,却仍会把立体问题压成平面问题。
二、多模态能力:从视觉到物理世界的映射
1. 看测量视频,在 Fusion 360 中设计零件
Daniel Griesser 的案例从头发堵住浴室地漏开始。他录制了约 4 分钟视频,边说明问题,边用数显卡尺测量零件。
据他描述,Astra Ultra 对齐了视频中的测量动作与语音,先提出方案、生成交互式草图;得到确认后,再通过电脑操作进入 Fusion 360,建立可修改尺寸和特征的参数化模型。他追加了一句“加些圆角”,模型继续修改,最终打印出的零件首次试装便能装上。
Daniel Griesser 展示地漏零件的设计与试装,并说明 Astra 在 Fusion 360 中保留了参数化建模过程。(中文机器翻译)原帖。
这个案例的价值不只是“画得像”。模型需要知道卡尺此刻测的是哪个位置,再把尺寸变成能制造的几何形状。作者也明确说,零件本身并不复杂;首次装得上,并未验证长期耐用性、材料选择或批量制造公差。人仍负责拍摄测量、确认方案和打印安装。
2. 看频谱猜声音:狗叫与光剑不是同一种结果
Max 的测试没有直接给模型音频,而是给了一张梅尔频谱图:横轴是时间,纵轴按人耳感知方式排列频率,颜色表示声音在各频段的强弱。
Astra 猜测是“反复的狗叫,带粗糙的低吼”,还写出“woof-woof, woof…”的节奏,并用低频主体、重复共振带和高频噪声边缘解释判断。回答本身标注了“最佳猜测”和“中等置信度”,比简单宣布“识别正确”多了一层信息。
Max 分享频谱猜音结果。(帖子中文机器翻译,模型输出为原文)原帖;狗叫回答原图。
光剑那张则经历了一次追问。完整对话原图显示,模型先猜电机或微波炉等机械嗡鸣;用户要求“再仔细看,试着听出来”,并未透露光剑这个答案。第二次回答才提出光剑点火、持续嗡鸣和熄灭,同时注明“仅凭频谱图不能确定”。这说明模型能在追问后重新考虑解释,不是第一轮就准确识别了声音。
光剑音效与频谱中的起始、持续嗡鸣和结束段。来源:Max。
3. 把药理机制做成可以旋转的分子演示
Andrew Aiginin让 Astra 解释 Ozempic(司美格鲁肽)的作用机制,并称一小时后得到了一个交互式分子旅程。演示包含 11 个章节,从 GLP-1 受体结合,到 cAMP 细胞内信号传递,再到胰岛素相关过程,配有可旋转、缩放的 3D 分子画面。
Andrew Aiginin 称 Astra 用约一小时完成 Ozempic 交互式解释。(中文机器翻译)原帖。
Ozempic 交互式分子旅程演示。来源:Andrew Aiginin。
从长段文字到可操作的教学界面,变化很直观。不过,动画中的仪表和数值并不因此成为实验数据。这是科学传播作品,不是经过医学审查的模拟器,也不能用来指导个人用药。
4. 48 关“我不是机器人”,究竟证明了什么?
Sharif Shameem 报告,Astra 完成了 neal.fun 的 “I’m Not a Robot” 全部 48 关。这款游戏把常见验证码变成逐渐升级的视觉谜题,既考识别,也考规则理解和操作。
Sharif Shameem 公布 48 关游戏通关结果;原帖没有完整披露重试或人工干预情况。(中文机器翻译)原帖。
Astra 操作“I’m Not a Robot”的游戏画面。来源:Sharif Shameem。
通关足够有趣,但“一次性、零干预”并非原帖已经证明的条件。真实网站的反机器人系统还涉及行为、设备和风险判断,不能据此宣布所有线上验证码都失效。
三、算力底座与产业共振:黄仁勋的“AGI 已来”
黄仁勋在原帖中写道:“AGI has arrived.” 他提到从 ChatGPT、o1 到 GPT-6 Astra 的四年历程,以及超过 10 万块 GPU 的训练集群,并称后续还将有 40 万块 GPU 上线。
Greg Brockman 转引黄仁勋的 AGI 表态与 GPU 集群规模。(中文机器翻译)黄仁勋原帖。
产业界显然仍在为更大规模的训练和运行投入资源。但“AGI 已来”是黄仁勋的判断,不是上述案例共同通过了一项 AGI 验收。GPU 数量也不能直接换算成智能倍数,更不能单凭规模解释为什么模型会忽略迷宫里的一面墙。
关于算力如何进一步参与 AI 研发,可结合 OpenAI 披露的研究 Agent 使用数据阅读:能并行运行更多任务,和每个任务都能独立做对,仍是两个问题。
四、结语:能设计零件,也会在墙前迷路
这组实测最有意思的地方,不是所有案例都在证明同一种“强”。Astra 可以把测量视频变成可编辑的零件,把药理解释变成交互演示,却仍会在立体迷宫中误判遮挡和高度。
对开发者而言,比“是否已经 AGI”更容易着手的问题是:选一件能验收的小任务,让它交出可修改的文件,再检查尺寸、规则或运行结果。地漏零件能否装上,和屏幕上的模型看起来是否漂亮,给出的答案可能完全不同。
如果想看相同提示词下的编程表现,可以接着读 Astra 与 Fable 5.1 的 3D 游戏实测,其中检查的是生成游戏能否通关,而不是模型自己能否走出迷宫。准备反复修改设计时,再对照 Astra 的 Plus 使用限制与 API 实际费用,区分订阅额度和单次调用账单。
通过 API 先做一个图片小测试
截至 9 月 8 日,SandBase 的 GPT-6 Astra 模型页列出的能力是文字和图片输入、文字输出。可以先准备一张已知声音来源的频谱图,不向模型透露标签,提问:“描述重复出现的图案,给出两种可能的声音来源,并说明仅凭这张图还不能确定什么。”再对照真实音频标签检查答案,不要把解释听起来合理算成识别正确。Vision 文档说明了图片传输与校验方式,请按所选模型的当前接口字段接入。
这个路由页面尚不能证明支持直接上传视频或音频。模型 API 也不附带 Fusion 360、桌面会话、鼠标键盘操作工具及相应权限。要复现建模案例,仍需另外准备这些组件,并由人核对尺寸;传一张图片只是规模更小的视觉分析测试。
FAQ
MazeBench 的 14% 是答对了 14% 的题吗?
这里按收集的宝石计分,满分 100。公开记录计入 14 颗宝石,不是对一套独立题目的平均正确率;访问房间数也不等于解题数。
Astra 是直接看着 3D 画面走迷宫的吗?
本文引用的记录是 ASCII 输入、关闭 Python 的配置。环境有三维几何关系,但不能把这次结果写成原始视频输入下的空间视觉测试。
可以照着案例直接打印模型设计的零件吗?
先核对尺寸、间隙和材料,再进行低风险试装。Daniel 的首装成功是一个具体案例,不是安全承重件、医疗器械或批量生产的验证。
看懂频谱图,等于模型真的听到了声音吗?
不等于。模型根据图中的时间与频率特征猜测来源;缺少原始音频和足够多的盲测样本,无法据此计算可靠的声音识别准确率。









