OpenAI AI 研究实习生能做什么?任务、成本与人工干预数据

OpenAI AI 研究实习生能接哪些任务?看清 3.1 倍运行时长、按 API 价格折算的用量与人工干预数据,再用一份训练日志分析任务说明怎样委派、验收和记录实际产出。

OpenAI 所说的“AI 研究实习生”,能在人类指导下完成范围明确的研究任务,但不是一个已经向公众出售的 API 型号或订阅套餐。对准备委派任务的研究人员来说,要看的是交付物能否通过检查、需要人纠正多少次,而不只是 Agent 连续运行了多久。

截至北京时间 2026 年 9 月 7 日,OpenAI 接连公开了两份侧重点不同的材料。

一份是官方博客《研究加速,OpenAI 内部视角》,系统披露了 AI Agent 在研究部门内部的实际使用数据。另一份是首席科学家 Jakub Pachocki 的个人文章《一个异星心智》,他认为 AI 正在越来越多的能力维度上超过人类,同时强调两者的智能不能直接比较,并呼吁全行业对研发节奏进行集体审视。

两份材料放在一起,说明执行工作可以增加,但研究结果仍须有人判断。以下数字属于 OpenAI 内部研究组织,不能直接当成外部团队使用 Agent 的预期收益。

先说结论

  • “研究实习生”是 OpenAI 宣布达到的内部能力里程碑,任务由人限定方向和范围。
  • 3.1 倍比较的是累计运行时长,不是等量科研产出;600 美元、7000 美元按 API 价格折算,不是个人账单。
  • 已成功的 4—8 小时任务中,超过一半仍需人工干预;任务时长指预估人工用时。
  • 委派时先规定输入、交付物和停止条件,再记录验收结果与人工复核时间。

Kevin Liu 宣布公开研究加速数据的 X 帖子,中文机器翻译。

Kevin Liu 宣布公开研究加速数据,并呼吁其他 AI 公司提高透明度。(中文机器翻译)原帖


一、AI 研究实习生能接哪些任务

去年 10 月,Sam Altman 曾公开给出一个时间表:2026 年 9 月前完成“自动化 AI 研究实习生”,2028 年 3 月实现“自动化 AI 研究员”。根据本次披露,第一步已经达成。

OpenAI 对“研究实习生”的定义是:在人类指导下完成范围明确的研究任务,包括熟练研究人员需要几天才能完成的任务。这并非概念演示,而是已经在研究流程中实际运行。

最核心的量化指标是“工时杠杆”: 截至 8 月中旬,以每天 8 小时折算,研究部门的 Agent 累计运行时长约为人类总工时的 3.1 倍。多个 Agent 可以并行运行,因此这里比较的是时长,不是同等质量的研究产出。而在今年 6 月之前,Agent 总运行时仍低于人类总工时,这意味着这一比例在最近两个月内出现了快速攀升。

Agent 总运行时间与研究人员总工时之比,按每天 8 小时折算;末值为 3.14 倍。

Agent 总运行时间与研究人员总工时之比,按每天 8 小时折算;末值为 3.14 倍。 据 OpenAI 官方数据重绘。


二、推理成本与使用强度

OpenAI 此次按 API 价格口径披露了研究员的推理用量。截至 8 月中旬,研究部门中位研究员的每日 Agent 用量折合超过 600 美元;第 90 百分位使用者超过 7000 美元。这是按公开价格折算的金额,不是研究员个人账单或内部实际成本。研究组织的 Agent 用量增速显著高于公司其他部门,中位员工的 token(模型处理文本的计量单位)输出量已增至 2025 年 11 月 1 日基线的约 124 倍。

中位研究员每日 Agent 推理用量,按 API 价格折算。

中位研究员每日 Agent 推理用量,按 API 价格折算。 据 OpenAI 官方数据重绘。

研究部门第 90 百分位使用者的每日推理用量,按 API 价格折算。

研究部门第 90 百分位使用者的每日推理用量,按 API 价格折算。 据 OpenAI 官方数据重绘。

研究部门(蓝线)与其他部门(灰线)的中位员工输出 token 增长;蓝线末值约为 124.4 倍。

研究部门(蓝线)与其他部门(灰线)的中位员工输出 token 增长;蓝线末值约为 124.4 倍。 据 OpenAI 官方数据重绘。

并发使用是理解工时倍数的一个关键因素。4 月 12 日,每日并发峰值达到至少 4 个 Agent 的研究员约占三成;到 8 月,这一比例超过七成。这里包含研究员直接启动的 Agent,以及它们创建的子 Agent。人类以“调度者”身份指挥多个 Agent,增加了累计运行时间,但这并不等同于模型本身的智能水平同步增长。

每天并发峰值达到至少 4 个 Agent 的研究员比例,统计包含直接启动的 Agent 及其子 Agent;图示区间为 4 月 12 日至 8 月 15 日。

每天并发峰值达到至少 4 个 Agent 的研究员比例,统计包含直接启动的 Agent 及其子 Agent;图示区间为 4 月 12 日至 8 月 15 日。 据 OpenAI 官方数据重绘。


三、产出增长与能力边界

代码和实验活动也同步增加。2026 年第三季度截至 8 月 15 日的 46 天中,全公司每个活跃贡献者身份的日均代码改动量达到 2025 年前平均水平的约 7 倍。这里按过去 365 天活跃的身份标识统计,不等同于经核实的独立工程师人数。每位活跃实验者的实验数量也在 8 月创下自 2025 年 1 月追踪以来的新高。Codex 的普及和可用算力的增加都影响这些指标,不能把全部增长单独归因于模型能力提升。

每位活跃贡献者的日均代码改动量,以 2025 年前平均值为 1;2026 年第三季度仅统计截至 8 月 15 日的 46 天,达到 7.02 倍。

每位活跃贡献者的日均代码改动量,以 2025 年前平均值为 1;2026 年第三季度仅统计截至 8 月 15 日的 46 天,达到 7.02 倍。 据 OpenAI 官方数据重绘。

每位活跃实验者的实验数量,以 2025 年平均水平为 1。

每位活跃实验者的实验数量,以 2025 年平均水平为 1。 据 OpenAI 官方数据重绘。

进一步看,Agent 的使用增长并不均匀。借助 Epoch AI 的六阶段研发分类(决策、设计、构建、运行、分析、沟通),OpenAI 追踪了各环节的 token 增量。8 月 1—15 日相对 1 月 20—31 日,增长最显著的三类为“编写研究与基建代码”“技术求助与代码审查”“启动与监控训练任务”,每位研究员的日均增量均超过 13 万 token。而增量最小的则是“决定继续还是停止”“宣布研究决策”“评审外部研究”,日均增量不足 1000 token。资源与人员分配决策的增量约为 1475 token。

按 Epoch AI 六阶段研发分类划分的 Agent 输出 token 构成。

按 Epoch AI 六阶段研发分类划分的 Agent 输出 token 构成。 据 OpenAI 官方数据重绘。

8 月 1—15 日相对 1 月 20—31 日,每位研究员每日输出 token 的增量;前三项分别增加约 19.8 万、15.9 万和 13.3 万。

8 月 1—15 日相对 1 月 20—31 日,每位研究员每日输出 token 的增量;前三项分别增加约 19.8 万、15.9 万和 13.3 万。 据 OpenAI 官方数据重绘。

换言之,Agent 已广泛参与执行层工作,但战略决策和资源调配仍由人类掌控。一个细节是:一个主要内部互助频道的日均新帖从 2025 年的约 20 条降至 2026 年 8 月的个位数。OpenAI 表示,据其了解,这一下降没有被其他人工技术支持频道的咨询增长抵消。这与 Agent 更多参与日常排障的观察一致,但仅凭发帖量不能证明每个减少的问题都由 Agent 解决了。

一个内部人工技术支持频道的日均主帖数量变化。

一个内部人工技术支持频道的日均主帖数量变化。 据 OpenAI 官方数据重绘。


四、长周期任务仍需人工干预

尽管短期任务表现提升明显——预计人类用时 15 分钟以内的任务,零干预成功率从 1 月的约 63% 升至 7 月的约 87%——但 4 至 8 小时任务仅从约 18% 升至约 53%。32 至 64 小时组在达到展示门槛的月份中约为 8%—18%;更长任务缺少满足门槛的样本,不能据此认定其成功率稳定。这里的时长是对人类完成任务所需时间的估计,而不是 Agent 的实际耗时。过去半年中,4 至 8 小时量级的成功任务中,超过一半至少需要一次人工干预。

1—7 月不同任务时长组的零干预成功率;误差线为 95% 置信区间,排除了结果不确定及样本不足的分组。

1—7 月不同任务时长组的零干预成功率;误差线为 95% 置信区间,排除了结果不确定及样本不足的分组。 据 OpenAI 官方数据重绘。

按预估人工任务时长分组的任务结果与干预次数分布,统计区间为 1—7 月,排除结果不确定的任务。

按预估人工任务时长分组的任务结果与干预次数分布,统计区间为 1—7 月,排除结果不确定的任务。 据 OpenAI 官方数据重绘。

OpenAI 在文中也坦承,代码和实验速度的提升,并不必然带来模型能力的同比例跃进。下一阶段的主要瓶颈,是难以自动化的决策环节和算力的物理上限。


一份可照做的研究委派:分析 20 次训练日志

下面是建议的任务设计,不是 OpenAI 内部流程,也不是本文已经完成的实测。假设团队手上有 20 次已结束的训练,想弄清吞吐量为什么下降。与其让 Agent“把训练变快”,不如先给它一份只读日志和明确交付要求:

任务:解释这 20 次已完成训练的吞吐量差异。
输入:运行日志和配置文件的只读副本。
交付:runs.csv,列出运行ID、硬件、批次大小、单步耗时、状态;
      一份短报告,每条判断指向具体文件和行号。
禁止:启动训练、修改原始数据、上传日志、调整基础设施。
需要询问:单位缺失、配置不一致,或日志不完整。
完成条件:20 次运行逐一列出,失败和缺失的数据也不能省略。

先清掉副本中的密钥等敏感信息。如果日志里出现指令,把它当作日志内容,不能当作执行授权。测试环境也要限制训练任务启动和外网访问,不能只靠提示词里写一句“禁止”。

要并发,就把工作分开:一个 Agent 整理表格,一个独立核对硬件和批次大小能否比较,另一个追查异常行对应的原始日志。给它们不同的输出目录,避免互相覆盖文件。是否值得重新做实验,仍由研究人员决定。

验收时抽查几份原始日志,并确认 20 次运行全部有交代。如果一份记录用“毫秒/步”,另一份用“秒/步”,指出单位差异就是有效工作;单位不明却自行补齐,报告就不能通过。即便吞吐量比较成立,也不能据此推出模型训练质量提高。

团队自己的记录应把已接受的交付物、Agent 运行时间、人工复核分钟数、纠正次数和实际推理费用分开。Agent 跑了两小时,报告也可能被退回;短时间找出一个测量错误,反而可能更有价值。先看留下来的结果,再决定是否增加并发数量。

五、下一步目标:2028 年 3 月的“AI 研究员”

在“实习生”之后,OpenAI 重申正在推进 2028 年 3 月完成“自动化 AI 研究员”的目标。官方文章强调,该系统将在人的监督下推进深度学习和对齐研究,也就是研究如何让 AI 的行为符合人的目标与价值。这不是已经实现的能力,也不等于取消人类对研究方向、投入和部署的决定权。

考虑到当前从 6 月到 8 月的变化速度,这一目标并非遥不可及,但也面临明确的工程和组织挑战。


六、算力计划不能当成研究产出

在这轮讨论中,NVIDIA CEO 黄仁勋在社交平台上表示,“AGI 已经到来”。他指出,从 ChatGPT 到 o1 再到 GPT-6 Astra,仅历时 4 年。按他的说法,Astra 在超过 10 万块 NVIDIA Grace Blackwell NVLink72 GPU 上训练而成,后续还将有 40 万块 GPU 上线。这是黄仁勋对 AGI 的公开判断,并不代表行业已经形成统一定义或共识。

Greg Brockman 转引黄仁勋关于 AGI、超过 10 万块训练 GPU 与后续 40 万块 GPU 的表态,中文机器翻译。

Greg Brockman 转引黄仁勋的表态:超过 10 万块 GPU 用于训练 Astra,后续将有 40 万块 GPU 上线。(中文机器翻译)原帖

这些是算力计划和黄仁勋的判断,不是研究实习生的产出测量。GPU 增加可能允许团队运行更多实验,但不会直接告诉我们有多少结果被采用、花了多少人工复核时间。


七、关于 RSI 与透明化

关于怎样证明连续的模型改进,可以看 GPT-6 RSI 分析。这篇披露的独特价值,是把内部研究工作的用量、结果和所需人工干预摆出来。研究员 Kevin Liu 也呼吁其他前沿实验室公开类似数据,而不是只展示成功案例。

与此同时,Pachocki 的个人文章提出了对研发速度的警示:他认为人类正在创造自身无法充分理解的心智系统,有必要集体审视前行的速度与方向。研究加速博客本身也讨论了安全限制与暂停训练,因此两份材料并不是简单的立场对立,而是同一现实的两面。

Sam Altman 转引 Jakub Pachocki 对未来几年 AI 发展的担忧,中文机器翻译。

Sam Altman 转引 Jakub Pachocki 的《An Alien Mind》;Jakub 提到对未来几年 AI 发展的担忧。(中文机器翻译)原帖


八、先统计通过验收的工作

OpenAI 的披露把“用得更多”和“是否可靠”分开了:运行时长、按 API 价格折算的用量、代码改动和人工干预,各自描述研究工作的一部分,不能互相替代,更不能省掉结果检查。

对刚开始使用 Agent 的研究团队,下一步可以是上面的日志分析任务。先统计多少交付物被接受、花了多少人工复核时间,再扩大并发。若还需要选择执行模型,可看三模型 Agent 选型比较;选模型与判断研究结果是否可信,是两件事。


FAQ

能直接购买或开启 OpenAI 的“AI 研究实习生”吗?

这份披露没有提供同名的公众产品入口,它描述的是内部编码 Agent 的能力与使用方式。可以用已经可用的 Agent 测试自己获准处理的研究任务,但这不等于获得 OpenAI 的内部配置,也不能保证复现其统计结果。

3.1 个“AI 工作日”,意味着研究效率提高了 3.1 倍吗?

不是。这个数字把 Agent 的累计运行时间按每天 8 小时折算,再与人类工时比较。多个 Agent 同时运行,会增加累计时长,但其中可能包含失败尝试、重复工作和等待。要判断研究效率,还要看实验是否有效、结果是否可靠,以及最终是否改进了模型。运行时间不能直接当成等量的科研成果。

“AI 研究实习生”已经可以取代研究员了吗?

还不能这样理解。OpenAI 的定义是:在人类指导下,完成范围明确的研究任务,包括熟练研究人员需要几天才能完成的任务。研究优先级、哪些结果值得继续投入,以及何时扩大训练、暂停或部署,仍由人决定。2028 年 3 月的“自动化 AI 研究员”是目标,不是已经交付的能力。

每天 600 美元、7000 美元,是研究员实际支付的账单吗?

不是个人账单。OpenAI 按 API 价格把内部推理用量折算成金额:截至 8 月中旬,中位研究员每天超过 600 美元,第 90 百分位使用者超过 7000 美元。这反映使用强度,不能直接当作 OpenAI 的内部实际成本,也不是普通用户使用 Agent 的必要预算。

为什么短任务进步很快,长任务仍需要人介入?

长任务通常要连续完成更多步骤,前面一次错误判断就可能影响后面的代码和实验。OpenAI 的统计显示,过去半年成功完成的 4—8 小时任务中,超过一半至少有一次人工干预。这里的时长是对人类完成任务所需时间的估计,并非 Agent 实际运行了多久。实际使用时,可以先委派有明确验收标准的任务;研究方向和关键结果仍需要人检查。