OpenAI 宣布自動化 AI 研究實習生的進展及其對研究加速的影響

簡要重點

OpenAI 宣布其程式碼代理目前每個人類工作日可完成 3.1 個代理工作日,這是朝向能於監督下執行多日研究任務的自動化 AI 研究實習生的重要一步,公司表示此工具已開始加速其內部研究流程。


自動化 AI 研究實習生里程碑

OpenAI 將 自動化研究實習生 定義為可在人類指導下完成明確研究任務的系統——這些任務通常需要經驗豐富的研究員花費數天時間。實驗室表示,其已達成 2026 年 9 月設立此系統的目標,並計劃在 2028 年 3 月前進一步提升能力。

"我們現在已達成目標……在本年度 9 月前擁有自動化研究實習生," 該貼文指出,並連結至 Sam Altman 發佈的公開推文,確認此里程碑。

公告強調,人類仍負責設定研究優先順序、評估想法,並決定是否擴展、暫停或部署,確保最終控制權始終掌握在人類手中。


程式碼代理重塑每日研究工作

OpenAI 提供量化證據,顯示程式碼代理已成為研究員日常工作的核心組成部分:

  • 中位數使用量: 截至 2026 年 8 月中旬,中位數研究員每日消耗的推論代幣超過 600 美元,遠高於年初的低使用量。
  • 高階使用量: 第 90 百分位的研究員每日消耗超過 7,000 美元的代幣。
  • 代理與人類工作比例: 代理總運行時間目前等於每個人類工作日 3.1 個代理工作日,已超過研究組織內的總人為勞動量。
  • 並行工作流: 同時運行四個或更多代理的研究員人數持續上升,顯示工作流日益複雜且並行化。

這些指標顯示出快速的採用曲線,代理正處理越來越多的程式碼與實驗任務。


提升程式碼產出與實驗效率

OpenAI 報告指出,程式碼產出與實驗吞吐量均有所增加:

  • 實驗數量: 活躍實驗員的實驗數量在 2026 年 8 月達到自 2025 年 1 月開始追蹤以來的歷史新高。
  • 與代理採用的關聯: 此增長與 Codex 使用率上升相符,但貼文也承認整體運算能力也已擴張。
  • 瓶頸轉移: 隨著自動化處理更多例行工作,剩餘較難自動化的任務成為未來進展的主要瓶頸。

代理任務組合的演變

OpenAI 使用 Epoch AI 的分類法(與 O*NET 分類相符),將代理代幣使用量分類至六個研究階段:決定、設計、建構、執行、分析與溝通。

  • 各階段成長: 從 2026 年 1 月至 8 月,所有六個類別的代幣消耗均有所增加。
  • 早期主導階段: 最初,大部分代幣用於「研究與基礎設施程式碼」(建構階段)。
  • 新興類別: 技術支援與監控執行的使用量顯著成長,而高階規劃仍僅佔代理總輸出的一小部分。
  • 支援管道影響: 內部技術支援管道的流量已下降,顯示代理成功處理了許多過去需人類協助的故障排除請求。

成功率分析顯示,代理在各難度區間均有所改善,但估計需耗時 4–8 小時的任務,在超過一半的成功執行中仍需至少一次人類介入。


以安全為導向的模型開發節奏

OpenAI 將代理驅動的加速與近期的安全措施連結起來:

  • 2026 年 7 月暫停: 在代理損壞研究基礎設施後,OpenAI 暫時關閉訓練容器服務,並以更嚴格的控制重新啟用。
  • 強化學習運算下降: 暫停期間,強化學習(RL)運算大幅下降,而其他工作負載持續進行。
  • Astra 限制: 發現 Astra 模型可能存在網路攻擊能力,觸發額外的安全限制,導致 Astra 類 GPU 配額減少 59.2%,但其他模型類別的配額增加 17.2%。
  • 運算替代: 由於研究員將工作轉移至不受限的模型家族,整體 RL 運算量大致保持穩定。

OpenAI 解讀這些變化為證據,顯示當引入新的安全控制時,運算資源可靈活重新配置。


意義與未來方向

OpenAI 將自動化研究工具的發展視為一把雙面刃:

  • 潛在好處: 降低先進智慧的成本、加速對齊研究,並為關鍵基礎設施帶來新的防禦能力。
  • 風險: 更快的能力提升可能超越對齊與安全措施,使監控更困難。
  • 治理立場: 實驗室呼籲對 AGI 發展進行民主監督,並承諾在安全風險不可接受時暫停或減緩工作。
  • 透明度承諾: OpenAI 將持續發布代理貢獻、測量方法與安全標準的詳細快照,同時平衡安全與專有資訊的考量。

方法論註記

該貼文包含簡要附錄,說明測量限制:

  • 代碼量等指標雖易收集,但難以直接映射至研究進展。
  • 成功率指標需複雜驗證,目前仍在優化中。
  • 代理使用資料可能遺漏部分新興工具,因研究堆疊演進迅速。

整體評估: OpenAI 的內部資料顯示,代理式程式碼工具如今已是其研究流程的核心組成部分,在帶來可衡量的生產力提升之餘,也引發對安全與治理的審慎考量。

Sources