OpenAI、自動化されたAI研究インターンの進展と研究加速への影響を発表
TL;DR
OpenAIは、コーディングエージェントが1人の人間の作業日に対し3.1回分のエージェント作業日を達成していることを発表した。これは、人間の監督下で数日間の研究タスクを実行できる自動化されたAI研究インターンへの重要な一歩であり、同社はこのツールがすでに内部の研究ワークフローを加速させていると述べている。
自動化されたAI研究インターンのマイルストーン
OpenAIは、自動化された研究インターンを、熟練した研究者が数日間を要する明確に定義された研究タスクを人間の指示のもとで完了できるシステムと定義している。研究室は、2026年9月までにそのようなシステムを導入するという目標を達成し、2028年3月までにさらなる能力向上を目指している。
"我々は今、今年の9月までに自動化された研究インターンを実現するという目標に到達した…"と投稿は述べ、Sam Altmanによる公開ツイートへのリンクを添付している。
発表では、人間が研究の優先順位を設定し、アイデアを評価し、スケーリング、一時停止、展開を決定することに変わりないとしており、最終的なコントロールは人間が保持していることを強調している。
コーディングエージェントが日々の研究作業を変革
OpenAIは、コーディングエージェントが研究者の日常業務に不可欠になったことを定量的に示している。
- 中央値の使用量: 2026年8月中旬時点で、中央値の研究者は1日あたり600ドル以上を推論トークンに費やしており、年初のわずかな使用量から大幅に増加している。
- 上位10%の使用量: 90パーセンタイルの研究者は1日あたり7,000ドル以上のトークンを消費している。
- エージェント対人間の作業比: エージェントの合計実行時間は、人間の作業日1日あたり3.1回分のエージェント作業日を達成しており、研究組織全体の人間労働を上回っている。
- 並行ワークフロー: 4つ以上のエージェントを同時に実行している研究者の数は継続的に増加しており、より複雑で並列化されたワークフローが進んでいることを示している。
これらの指標は、エージェントがコーディングや実験タスクの多くを担うようになる急速な採用傾向を示している。
コード生産量と実験の増加
OpenAIは、コード出力と実験のスループットの両方が向上していると報告している。
- 実験数: 2026年8月に、アクティブな実験者1人あたりの実験数は、2025年1月から追跡を開始して以来の最高値に達した。
- エージェント採用との相関: この急増は、Codexの使用率の上昇と一致しているが、投稿は全体的なコンピューティング容量の拡大も要因であると認めている。
- ボトルネックの移行: 自動化がより日常的な作業を処理するようになるにつれ、残る自動化が難しいタスクが将来の進展における主なボトルネックとなる。
エージェントのタスク構成の進化
Epoch AIのO*NET分類を模倣した分類法を用いて、OpenAIはエージェントのトークン使用量を6つの研究フェーズ(決定、設計、構築、実行、分析、報告)に分類している。
- 各フェーズでの成長: 2026年1月から8月にかけて、6つのカテゴリすべてでトークン消費量が増加した。
- 初期の主要フェーズ: 初期には、ほとんどのトークンが「研究およびインフラストラクチャコード」(構築フェーズ)に費やされていた。
- 成長中のカテゴリ: 技術的サポートとモニタリング実行の使用量が顕著に増加している一方、高レベルの計画はエージェント出力全体のわずかな割合にとどまっている。
- サポートチャネルへの影響: 内部の技術サポートチャネルのトラフィックは減少しており、エージェントが以前は人間の支援が必要だった多くのトラブルシューティング要求を成功裏に処理していることを示している。
成功率分析では、エージェントは難易度の異なるタスクすべてで改善が見られ、ただし4〜8時間かかると予想されるタスクは、成功した実行の半数以上で少なくとも1回の人間の介入が必要であることが判明している。
セーフティを重視したモデル開発のペース設定
OpenAIは、エージェント駆動の加速と最近のセーフティ対策を関連付けている。
- 2026年7月の一時停止: エージェントが研究インフラを損傷した後、OpenAIは一時的にトレーニングコンテナサービスを停止し、より厳格な制御を導入して再稼働させた。
- RLコンピューティングの低下: 一時停止期間中、強化学習(RL)のコンピューティングは急激に減少したが、他のワークロードは継続した。
- Astraの制限: Astraモデルに潜在的なサイバー能力が発見されたことを受けて、追加のセキュリティ制約が導入され、AstraクラスのGPU割当は59.2%削減されたが、他のモデルクラスへの割当は17.2%増加した。
- コンピューティングの代替: RLコンピューティングの全体的な量は、研究者が制限のないモデルファミリーに作業を移行したため、概ね安定したままだった。
OpenAIは、これらの変化が、新しいセーフティ制御を導入した際にコンピューティングリソースを柔軟に再配分できる可能性を示していると解釈している。
意味と今後の方向性
OpenAIは、自動化された研究ツールの開発が二面性を持つと位置づけている。
- 潜在的な利点: 高度な知能のコスト低下、アライメント研究の加速、重要なインフラストラクチャに対する新たな防御能力。
- リスク: 能力の急速な向上がアライメントやセーフティ対策を追い越す可能性があり、監視が難しくなる。
- ガバナンスの立場: 研究室はAGI開発に対する民主的監視を呼びかけ、安全リスクが許容できない状態になった場合には作業を一時停止または遅らせるという誓約をしている。
- 透明性へのコミットメント: OpenAIは、エージェントの貢献、測定方法、セーフティ基準の詳細なスナップショットを継続的に公開していくが、セキュリティと独自性の懸念とのバランスを取る。
方法論的注意点
投稿には、測定の限界についての簡単な付録が含まれている。
- コード量のような指標は収集しやすいが、研究進捗に直接対応させるのは難しい。
- 成功率指標は複雑な検証を必要とし、まだ改良中である。
- エージェント使用データは、研究スタックの急速な進化により、一部の新興ツールを含んでいない可能性がある。
全体的な評価: OpenAIの内部データは、エージェント型コーディングツールが現在、研究ワークフローの中心的な構成要素となっており、測定可能な生産性向上をもたらしている一方で、慎重なセーフティとガバナンスの検討を促していることを示している。