Claude 如何用于科研?金星制图、蛋白质设计与 GPU 加速
拆解 Fable 5.1 与 Mythos 5.1 的三项科研案例:金星地形重建、蛋白质候选实验验证、GPU Kernel 加速,分别核对输入、结果、样本与适用限制。
先说结论
Anthropic 这次最有价值的证据,不是模型“变成了科学家”,而是一个能力更强的 Agent 能把观测、工具选择、计算、调试和候选生成串成一条科研工作流。
想把 Claude 用于科研,先判断你需要的是重建地图、提出候选,还是降低已有模型的计算费用。Anthropic 的 Fable 5.1 / Mythos 5.1 发布页分别展示了这三类案例。本文面向准备尝试模型工具的科研人员与研究软件工程师:每个案例都按输入、产出和仍需检查的部分拆开,不把厂商演示写成本实验室已复现。
三种不同的科研工作
这些案例很容易被合并成一句“AI开始做科学了”,但它们考验的是三种不同能力。
1. Fable 5.1 重建金星地形
金星章节并列展示麦哲伦雷达、旧高程数据、新 DEM 和火山参考视图。
官方案例使用 NASA 麦哲伦号的历史雷达图像,以及已有的覆盖约五分之一金星的地图。Fable 5.1 训练神经网络后得到覆盖约三分之一金星的新高程图;发布页报告可辨识细节从 10–20 公里改善到 2–3 公里,高度估计准确性最高改善 25%。图中的 DEM(数字高程模型)标注 300 米网格,不能把这个采样间距当作真实细节已达到 300 米。这是一个困难的逆问题:模型要从不完整测量中学习地形关系,再生成能够与留出的或更高质量观测对比的结果。
科学问题不在于生成图像看起来是否更细,而在于它是否改善了可测量的估计,同时没有凭空捏造数据无法支持的结构。可靠评估应报告训练划分、空间分辨率、基线方法、误差指标和不确定性,而不只是展示前后对比图。
2. 设计蛋白质候选物
Anthropic 展示了经实验确认的结合物案例,并把它放在调用多种工具的蛋白设计流程中。
蛋白设计更能说明这是一条工作流,而不是一个答案。Agent 可以选择结合位点、调用公开设计工具、处理失败运行,再为外部实验提出候选。在本次发布案例中,Mythos 5.1 调用开源工具生成候选,交由两家外部机构进行实验验证。官方报告的总体命中率接近 50%,覆盖 12 个靶点;它衡量的是候选是否成为有效结合物,不是药物获批率。
它的价值在于解决了科研编排瓶颈:决定下一步实验、在工具之间传递结果,并持续保持约束。但生成的结构不是药物。结合亲和力、特异性、稳定性、毒性、可制造性和体内表现,仍然需要实验验证。
3. Mythos 5.1 优化 GPU Kernel
官方图表列出七个开源蛋白质与基因组模型的推理加速结果。
GPU Kernel 是在显卡上执行某项计算的小程序。官方在 NVIDIA H100 上报告了七个开源模型的优化结果:加速约 1.4–2.5 倍;其中 ProGen2 的示例达到 2.5 倍,Evo 2 40B 的单次前向计算约 1.4 倍。目标不是提出新假说,而是在保持计算等价的前提下提高速度。验收标准也更具体:与参考实现对比输出、覆盖边界条件、在真实形状上测性能,并检查数值误差。
这是 Agent 能产生直接运营价值的地方。一次小幅加速乘以数百万次推理,就会改变实验室的成本和吞吐。但“更快”只有在结果保持科学等价,并且测试包含编译、内存搬运和生产形状时才有意义。
共同模式:工具驱动的推理
三个案例共享一条循环:
问题 -> 检查数据 -> 选择工具 -> 执行实验 -> 检查结果 -> 修订
模型负责规划和适应,工具负责领域操作,评估器负责定义成功。缺少其中任何一环,标题里的突破都会缩水。
实验室若要真正采用这套流程,应保存提示词、工具版本、参数、中间产物、失败记录和最终决策。没有溯源的结果是演示;带有溯源的结果才可能成为科研输入。
宣称“发现”前要测什么
可以从四层证据开始:
- 可复现: 另一支团队能否根据记录的输入重跑?
- 有效: 结果能否通过领域检查和外部实验?
- 新颖: 候选是否真正新颖,还是从工具和训练分布中重新发现?
- 效率: Agent 节省了多少专家时间、算力和迭代次数?
这些问题可以避免一种常见的概念混淆:找到已知 Bug、加速已知 Kernel 或生成可测试的蛋白候选,都可能极其有用,但不等于模型独立建立了科学理论。
Mythos 的访问权限为什么会改变实验设计
Anthropic 表示,Fable 5.1 与 Mythos 5.1 共享底层模型,但 Mythos 面向审核通过的网络安全与生命科学机构,拥有更宽的访问边界。这会直接影响实验:公开 Fable 会对部分生物学请求回退,而获批的 Mythos 工作流可能执行更多领域工具链。
每个实验应记录请求模型及服务实际披露的回退信息;如果内部型号或安全路由没有披露,就标记未知。否则实验室可能把一次直接 Mythos 运行与一次 Fable 回退运行放在一起比较,最后却把差异错误归因于提示词或工具选择。
科研团队近期最现实的用法
真正的机会不是把科学家从环路里删掉,而是让专家更多负责问题选择、实验设计、审查和解释,把重复检索、工具胶合、实现和失败恢复交给 Agent。
这种分工可以缩短从想法到验证候选的时间,也可能在实验室把流畅报告误当成证据时放大错误。因此更稳妥的架构是围绕模型建立证据账本,而不是给聊天窗口套一个“科学”提示词。
Fable 5.1 的科研意义可以这样谨慎表述:它展示了更完整的科研助手流程。这个流程能否产出持久的科学发现,取决于周围的仪器、控制和专家。
三类科研贡献怎么比较
| 工作 | Agent 贡献什么 | 仍需验证什么 | 有用的成功指标 |
|---|---|---|---|
| 行星重建 | 模型选择、预处理和重建 | 留出误差与不确定性 | 相比基线地图的改进 |
| 蛋白设计 | 候选搜索与工具编排 | 湿实验结合、稳定性与安全性 | 每次实验的验证候选数 |
| GPU 优化 | Kernel 实现与性能分析 | 数值等价与边界条件 | 相同输出下的吞吐量 |
把三者都塞进一个“发现分数”并不诚实。第一类是推断问题,第二类是提出假说,第三类是系统工程;每一类需要的证据不同。
这些数字来自官方发布页,不是本文的独立实验。重跑前仍需获得源数据、方法和实验条件;一页发布说明不能代替论文方法部分或完整的实验记录。
FAQ
Fable 5.1 独立发现了新的科学规律吗?
现有公开证据支持的是 AI 辅助科研工作流,而不是“独立完成科学发现”这一笼统结论。科学主张仍需要可复现输入、方法、不确定性和领域验证。
为什么生物学案例更多和 Mythos 关联,而不是普通 Fable?
Anthropic 对生物学和化学增加了额外护栏。部分 Fable 请求可能回退到 Opus,获邀参与 LSVP 的生命科学机构则按该计划的研究护栏使用 Mythos,不是所有通过一般身份验证的机构都可直接开通。
实验室应该保存 Agent 运行中的什么?
保存提示词、源数据哈希、工具和模型版本、参数、中间文件、失败记录、生成候选和人工决策。没有溯源,流畅的结果很难复现,也很难质疑。
GPU Kernel 更快,就一定意味着科研结果更好吗?
不一定。它必须在约定数值容差内产出等价结果,覆盖真实输入形状,并且把编译和内存传输成本算进去后仍然更快。
单次加速和整项分析省钱,不是同一个数字
官方对 Evo 2 40B 扫描 300 万个 ClinVar 变异的例子,按 H100 云端标价估算 GPU 费用从 1.8 万美元降至 8 千美元。整项任务约 2.3 倍的改善高于单次前向计算的 1.4 倍,因为某些中间结果缓存只有在大量序列上重复使用时才见效。这是特定分析的费用估算,不是所有基因组任务的实付账单。
如果你的实验只跑几十个样本,编译和数据搬运可能比计算更耗时;如果换了 GPU 或序列长度,也需要重测。先测同一输入的数值误差,再测端到端耗时,最后才按你实际购买的机器价格估算费用。
普通 API 用户可以从哪里尝试
Mythos 的研究权限仍需官方审核。LSVP 是邀请制生命科学测试;CVP 公告则说明 Mythos 访问将后续加入,不能把两者都当成已开放的普通 API。详细条件见Fable 与 Mythos 的访问区别。
对公开模型可做的代码与验证任务,可先参考Claude / Lean 小题测试,再在 SandBase Anthropic 模型页核对可用型号。这里的模型调用不包含湿实验服务,也不能自动获得 Mythos 研究权限。
来源(2026 年 9 月 8 日核对):Fable 5.1 / Mythos 5.1 科研与成本说明、Claude Fable、Claude Mythos。


