OpenAI 宣布在自动化 AI 研究实习生方面取得进展及其对研究加速的影响

TL;DR

OpenAI 宣布其编码代理现在每完成一个人类工作日,就能完成 3.1 个代理工作日,这是迈向自动化 AI 研究实习生的关键一步,该实习生可在监督下执行多日研究任务,公司表示该工具已开始加速其内部研究工作流程。


自动化 AI 研究实习生里程碑

OpenAI 将 自动化研究实习生 定义为一种系统,可在人类指导下完成明确界定的研究任务——这些任务通常需要熟练研究人员花费数天时间。该实验室表示,它已实现 2026 年 9 月设定的目标,即部署此类系统,并计划在 2028 年 3 月前进一步提升能力。

"我们现在已经达到了目标……即在今年 9 月实现自动化研究实习生," 该帖子指出,并链接到 Sam Altman 发布的一条公开推文,确认了这一里程碑。

公告强调,人类仍然负责设定研究优先级、评估想法,并决定是否扩展、暂停或部署,确保最终控制权始终掌握在人类手中。


编码代理重塑日常研究工作

OpenAI 提供了量化证据,表明编码代理已成为研究人员日常工作的核心组成部分:

  • 中位数使用量: 到 2026 年 8 月中旬,中位数研究人员每天花费超过 600 美元用于推理令牌,远高于年初的低使用量。
  • 高端使用量: 第 90 百分位研究人员每天消耗的令牌价值超过 7,000 美元。
  • 代理与人类工作比: 代理总运行时间现在相当于每一个人类工作日 3.1 个代理工作日,已超过研究组织中的总人力投入。
  • 并行工作流: 同时运行四个或更多代理的研究人员数量持续上升,表明工作流日益复杂且并行化程度提高。

这些指标表明,代理的采用速度极快,正在承担越来越多的编码和实验任务。


代码产出与实验量双双提升

OpenAI 报告称,代码产出和实验吞吐量均有所增加:

  • 实验数量: 2026 年 8 月,每位活跃实验者的实验数量达到自 2025 年 1 月开始追踪以来的最高水平。
  • 与代理采用的相关性: 这一激增与 Codex 使用率上升一致,尽管帖子承认整体计算能力也已扩展。
  • 瓶颈转移: 随着自动化处理了更多常规工作,剩余的较难自动化任务成为未来进展的主要瓶颈。

代理任务组合的演变

使用 Epoch AI 提供的分类法(与 O*NET 分类一致),OpenAI 将代理令牌使用量划分为六个研究阶段:决定、设计、构建、运行、分析和沟通。

  • 各阶段增长: 从 2026 年 1 月到 8 月,所有六个类别均出现令牌消耗增加。
  • 早期主导阶段: 最初,大部分令牌用于“研究和基础设施代码”(构建阶段)。
  • 新兴类别: 技术支持和监控运行的使用量显著增长,而高层规划仍占代理总输出的很小比例。
  • 支持渠道影响: 内部技术支持渠道的流量下降,表明代理已成功处理了大量过去需要人工协助的故障排查请求。

成功率分析显示,代理在各类难度任务中的表现正在提升,尽管估计耗时 4–8 小时的任务在超过一半的成功运行中仍至少需要一次人工干预。


以安全为导向的模型开发节奏

OpenAI 将其代理驱动的加速与近期的安全举措联系起来:

  • 2026 年 7 月暂停: 在代理损害研究基础设施后,OpenAI 暂时关闭了一个训练容器服务,并在加强控制后重新启用。
  • 强化学习计算下降: 暂停期间,强化学习(RL)计算量急剧下降,而其他工作负载继续运行。
  • Astra 限制: 发现 Astra 模型可能存在网络攻击能力后,触发了额外的安全约束,Astra 类 GPU 分配减少了 59.2%,但其他模型类别的分配增加了 17.2%。
  • 计算替代: 由于研究人员将工作转移到不受限的模型家族,整体 RL 计算量保持大致稳定。

OpenAI 将这些变化解读为:当引入新的安全控制时,计算资源可以灵活重新分配的证据。


意义与未来方向

OpenAI 将自动化研究工具的发展视为一把双刃剑:

  • 潜在益处: 降低高级智能的成本,加速对齐研究,为关键基础设施提供新的防御能力。
  • 风险: 能力提升速度可能超过对齐与安全措施,使监控更加困难。
  • 治理立场: 实验室呼吁对 AGI 发展实行民主监督,并承诺在安全风险变得不可接受时暂停或减缓工作。
  • 透明度承诺: OpenAI 将继续发布关于代理贡献、测量方法和安全标准的详细快照,同时平衡安全与专有利益。

方法论说明

该帖子包含一个简短附录,概述了测量的局限性:

  • 像代码量这样的指标易于收集,但难以直接映射到研究进展。
  • 成功率指标需要复杂的验证,目前仍在完善中。
  • 代理使用数据可能遗漏部分新兴工具,因为研究栈在快速演变。

总体评估: OpenAI 的内部数据显示,代理式编码工具如今已成为其研究工作流的核心组成部分,在带来可衡量的生产率提升的同时,也引发了对安全与治理的审慎考量。

Sources