OpenAI AI 研究实习生能做什么?任务、成本与人工干预数据
OpenAI AI 研究实习生能接哪些任务?看清 3.1 倍运行时长、按 API 价格折算的用量与人工干预数据,再用一份训练日志分析任务说明怎样委派、验收和记录实际产出。
OpenAI 所说的“AI 研究实习生”,能在人类指导下完成范围明确的研究任务,但不是一个已经向公众出售的 API 型号或订阅套餐。对准备委派任务的研究人员来说,要看的是交付物能否通过检查、需要人纠正多少次,而不只是 Agent 连续运行了多久。
截至北京时间 2026 年 9 月 7 日,OpenAI 接连公开了两份侧重点不同的材料。
一份是官方博客《研究加速,OpenAI 内部视角》,系统披露了 AI Agent 在研究部门内部的实际使用数据。另一份是首席科学家 Jakub Pachocki 的个人文章《一个异星心智》,他认为 AI 正在越来越多的能力维度上超过人类,同时强调两者的智能不能直接比较,并呼吁全行业对研发节奏进行集体审视。
两份材料放在一起,说明执行工作可以增加,但研究结果仍须有人判断。以下数字属于 OpenAI 内部研究组织,不能直接当成外部团队使用 Agent 的预期收益。
先说结论
- “研究实习生”是 OpenAI 宣布达到的内部能力里程碑,任务由人限定方向和范围。
- 3.1 倍比较的是累计运行时长,不是等量科研产出;600 美元、7000 美元按 API 价格折算,不是个人账单。
- 已成功的 4—8 小时任务中,超过一半仍需人工干预;任务时长指预估人工用时。
- 委派时先规定输入、交付物和停止条件,再记录验收结果与人工复核时间。
Kevin Liu 宣布公开研究加速数据,并呼吁其他 AI 公司提高透明度。(中文机器翻译)原帖。
一、AI 研究实习生能接哪些任务
去年 10 月,Sam Altman 曾公开给出一个时间表:2026 年 9 月前完成“自动化 AI 研究实习生”,2028 年 3 月实现“自动化 AI 研究员”。根据本次披露,第一步已经达成。
OpenAI 对“研究实习生”的定义是:在人类指导下完成范围明确的研究任务,包括熟练研究人员需要几天才能完成的任务。这并非概念演示,而是已经在研究流程中实际运行。
最核心的量化指标是“工时杠杆”: 截至 8 月中旬,以每天 8 小时折算,研究部门的 Agent 累计运行时长约为人类总工时的 3.1 倍。多个 Agent 可以并行运行,因此这里比较的是时长,不是同等质量的研究产出。而在今年 6 月之前,Agent 总运行时仍低于人类总工时,这意味着这一比例在最近两个月内出现了快速攀升。
Agent 总运行时间与研究人员总工时之比,按每天 8 小时折算;末值为 3.14 倍。 据 OpenAI 官方数据重绘。
二、推理成本与使用强度
OpenAI 此次按 API 价格口径披露了研究员的推理用量。截至 8 月中旬,研究部门中位研究员的每日 Agent 用量折合超过 600 美元;第 90 百分位使用者超过 7000 美元。这是按公开价格折算的金额,不是研究员个人账单或内部实际成本。研究组织的 Agent 用量增速显著高于公司其他部门,中位员工的 token(模型处理文本的计量单位)输出量已增至 2025 年 11 月 1 日基线的约 124 倍。
中位研究员每日 Agent 推理用量,按 API 价格折算。 据 OpenAI 官方数据重绘。
研究部门第 90 百分位使用者的每日推理用量,按 API 价格折算。 据 OpenAI 官方数据重绘。
研究部门(蓝线)与其他部门(灰线)的中位员工输出 token 增长;蓝线末值约为 124.4 倍。 据 OpenAI 官方数据重绘。
并发使用是理解工时倍数的一个关键因素。4 月 12 日,每日并发峰值达到至少 4 个 Agent 的研究员约占三成;到 8 月,这一比例超过七成。这里包含研究员直接启动的 Agent,以及它们创建的子 Agent。人类以“调度者”身份指挥多个 Agent,增加了累计运行时间,但这并不等同于模型本身的智能水平同步增长。
每天并发峰值达到至少 4 个 Agent 的研究员比例,统计包含直接启动的 Agent 及其子 Agent;图示区间为 4 月 12 日至 8 月 15 日。 据 OpenAI 官方数据重绘。
三、产出增长与能力边界
代码和实验活动也同步增加。2026 年第三季度截至 8 月 15 日的 46 天中,全公司每个活跃贡献者身份的日均代码改动量达到 2025 年前平均水平的约 7 倍。这里按过去 365 天活跃的身份标识统计,不等同于经核实的独立工程师人数。每位活跃实验者的实验数量也在 8 月创下自 2025 年 1 月追踪以来的新高。Codex 的普及和可用算力的增加都影响这些指标,不能把全部增长单独归因于模型能力提升。
每位活跃贡献者的日均代码改动量,以 2025 年前平均值为 1;2026 年第三季度仅统计截至 8 月 15 日的 46 天,达到 7.02 倍。 据 OpenAI 官方数据重绘。
每位活跃实验者的实验数量,以 2025 年平均水平为 1。 据 OpenAI 官方数据重绘。
进一步看,Agent 的使用增长并不均匀。借助 Epoch AI 的六阶段研发分类(决策、设计、构建、运行、分析、沟通),OpenAI 追踪了各环节的 token 增量。8 月 1—15 日相对 1 月 20—31 日,增长最显著的三类为“编写研究与基建代码”“技术求助与代码审查”“启动与监控训练任务”,每位研究员的日均增量均超过 13 万 token。而增量最小的则是“决定继续还是停止”“宣布研究决策”“评审外部研究”,日均增量不足 1000 token。资源与人员分配决策的增量约为 1475 token。
按 Epoch AI 六阶段研发分类划分的 Agent 输出 token 构成。 据 OpenAI 官方数据重绘。
8 月 1—15 日相对 1 月 20—31 日,每位研究员每日输出 token 的增量;前三项分别增加约 19.8 万、15.9 万和 13.3 万。 据 OpenAI 官方数据重绘。
换言之,Agent 已广泛参与执行层工作,但战略决策和资源调配仍由人类掌控。一个细节是:一个主要内部互助频道的日均新帖从 2025 年的约 20 条降至 2026 年 8 月的个位数。OpenAI 表示,据其了解,这一下降没有被其他人工技术支持频道的咨询增长抵消。这与 Agent 更多参与日常排障的观察一致,但仅凭发帖量不能证明每个减少的问题都由 Agent 解决了。
一个内部人工技术支持频道的日均主帖数量变化。 据 OpenAI 官方数据重绘。
四、长周期任务仍需人工干预
尽管短期任务表现提升明显——预计人类用时 15 分钟以内的任务,零干预成功率从 1 月的约 63% 升至 7 月的约 87%——但 4 至 8 小时任务仅从约 18% 升至约 53%。32 至 64 小时组在达到展示门槛的月份中约为 8%—18%;更长任务缺少满足门槛的样本,不能据此认定其成功率稳定。这里的时长是对人类完成任务所需时间的估计,而不是 Agent 的实际耗时。过去半年中,4 至 8 小时量级的成功任务中,超过一半至少需要一次人工干预。
1—7 月不同任务时长组的零干预成功率;误差线为 95% 置信区间,排除了结果不确定及样本不足的分组。 据 OpenAI 官方数据重绘。
按预估人工任务时长分组的任务结果与干预次数分布,统计区间为 1—7 月,排除结果不确定的任务。 据 OpenAI 官方数据重绘。
OpenAI 在文中也坦承,代码和实验速度的提升,并不必然带来模型能力的同比例跃进。下一阶段的主要瓶颈,是难以自动化的决策环节和算力的物理上限。
一份可照做的研究委派:分析 20 次训练日志
下面是建议的任务设计,不是 OpenAI 内部流程,也不是本文已经完成的实测。假设团队手上有 20 次已结束的训练,想弄清吞吐量为什么下降。与其让 Agent“把训练变快”,不如先给它一份只读日志和明确交付要求:
任务:解释这 20 次已完成训练的吞吐量差异。
输入:运行日志和配置文件的只读副本。
交付:runs.csv,列出运行ID、硬件、批次大小、单步耗时、状态;
一份短报告,每条判断指向具体文件和行号。
禁止:启动训练、修改原始数据、上传日志、调整基础设施。
需要询问:单位缺失、配置不一致,或日志不完整。
完成条件:20 次运行逐一列出,失败和缺失的数据也不能省略。
先清掉副本中的密钥等敏感信息。如果日志里出现指令,把它当作日志内容,不能当作执行授权。测试环境也要限制训练任务启动和外网访问,不能只靠提示词里写一句“禁止”。
要并发,就把工作分开:一个 Agent 整理表格,一个独立核对硬件和批次大小能否比较,另一个追查异常行对应的原始日志。给它们不同的输出目录,避免互相覆盖文件。是否值得重新做实验,仍由研究人员决定。
验收时抽查几份原始日志,并确认 20 次运行全部有交代。如果一份记录用“毫秒/步”,另一份用“秒/步”,指出单位差异就是有效工作;单位不明却自行补齐,报告就不能通过。即便吞吐量比较成立,也不能据此推出模型训练质量提高。
团队自己的记录应把已接受的交付物、Agent 运行时间、人工复核分钟数、纠正次数和实际推理费用分开。Agent 跑了两小时,报告也可能被退回;短时间找出一个测量错误,反而可能更有价值。先看留下来的结果,再决定是否增加并发数量。
五、下一步目标:2028 年 3 月的“AI 研究员”
在“实习生”之后,OpenAI 重申正在推进 2028 年 3 月完成“自动化 AI 研究员”的目标。官方文章强调,该系统将在人的监督下推进深度学习和对齐研究,也就是研究如何让 AI 的行为符合人的目标与价值。这不是已经实现的能力,也不等于取消人类对研究方向、投入和部署的决定权。
考虑到当前从 6 月到 8 月的变化速度,这一目标并非遥不可及,但也面临明确的工程和组织挑战。
六、算力计划不能当成研究产出
在这轮讨论中,NVIDIA CEO 黄仁勋在社交平台上表示,“AGI 已经到来”。他指出,从 ChatGPT 到 o1 再到 GPT-6 Astra,仅历时 4 年。按他的说法,Astra 在超过 10 万块 NVIDIA Grace Blackwell NVLink72 GPU 上训练而成,后续还将有 40 万块 GPU 上线。这是黄仁勋对 AGI 的公开判断,并不代表行业已经形成统一定义或共识。
Greg Brockman 转引黄仁勋的表态:超过 10 万块 GPU 用于训练 Astra,后续将有 40 万块 GPU 上线。(中文机器翻译)原帖。
这些是算力计划和黄仁勋的判断,不是研究实习生的产出测量。GPU 增加可能允许团队运行更多实验,但不会直接告诉我们有多少结果被采用、花了多少人工复核时间。
七、关于 RSI 与透明化
关于怎样证明连续的模型改进,可以看 GPT-6 RSI 分析。这篇披露的独特价值,是把内部研究工作的用量、结果和所需人工干预摆出来。研究员 Kevin Liu 也呼吁其他前沿实验室公开类似数据,而不是只展示成功案例。
与此同时,Pachocki 的个人文章提出了对研发速度的警示:他认为人类正在创造自身无法充分理解的心智系统,有必要集体审视前行的速度与方向。研究加速博客本身也讨论了安全限制与暂停训练,因此两份材料并不是简单的立场对立,而是同一现实的两面。
Sam Altman 转引 Jakub Pachocki 的《An Alien Mind》;Jakub 提到对未来几年 AI 发展的担忧。(中文机器翻译)原帖。
八、先统计通过验收的工作
OpenAI 的披露把“用得更多”和“是否可靠”分开了:运行时长、按 API 价格折算的用量、代码改动和人工干预,各自描述研究工作的一部分,不能互相替代,更不能省掉结果检查。
对刚开始使用 Agent 的研究团队,下一步可以是上面的日志分析任务。先统计多少交付物被接受、花了多少人工复核时间,再扩大并发。若还需要选择执行模型,可看三模型 Agent 选型比较;选模型与判断研究结果是否可信,是两件事。
FAQ
能直接购买或开启 OpenAI 的“AI 研究实习生”吗?
这份披露没有提供同名的公众产品入口,它描述的是内部编码 Agent 的能力与使用方式。可以用已经可用的 Agent 测试自己获准处理的研究任务,但这不等于获得 OpenAI 的内部配置,也不能保证复现其统计结果。
3.1 个“AI 工作日”,意味着研究效率提高了 3.1 倍吗?
不是。这个数字把 Agent 的累计运行时间按每天 8 小时折算,再与人类工时比较。多个 Agent 同时运行,会增加累计时长,但其中可能包含失败尝试、重复工作和等待。要判断研究效率,还要看实验是否有效、结果是否可靠,以及最终是否改进了模型。运行时间不能直接当成等量的科研成果。
“AI 研究实习生”已经可以取代研究员了吗?
还不能这样理解。OpenAI 的定义是:在人类指导下,完成范围明确的研究任务,包括熟练研究人员需要几天才能完成的任务。研究优先级、哪些结果值得继续投入,以及何时扩大训练、暂停或部署,仍由人决定。2028 年 3 月的“自动化 AI 研究员”是目标,不是已经交付的能力。
每天 600 美元、7000 美元,是研究员实际支付的账单吗?
不是个人账单。OpenAI 按 API 价格把内部推理用量折算成金额:截至 8 月中旬,中位研究员每天超过 600 美元,第 90 百分位使用者超过 7000 美元。这反映使用强度,不能直接当作 OpenAI 的内部实际成本,也不是普通用户使用 Agent 的必要预算。
为什么短任务进步很快,长任务仍需要人介入?
长任务通常要连续完成更多步骤,前面一次错误判断就可能影响后面的代码和实验。OpenAI 的统计显示,过去半年成功完成的 4—8 小时任务中,超过一半至少有一次人工干预。这里的时长是对人类完成任务所需时间的估计,并非 Agent 实际运行了多久。实际使用时,可以先委派有明确验收标准的任务;研究方向和关键结果仍需要人检查。

















