OpenAI GPT-5 早期科學加速實驗

OpenAI 已發表一篇題為「早期科學加速實驗與 GPT-5」的研究論文,記錄了與大學和國家實驗室的合作,以測試模型加速科學發現的能力。研究結果表明,儘管 GPT-5 不是自主的科學家,但它透過綜合已知結果、產生新穎的證明並提出可驗證的生物機制,為專家提供了強大的乘數效應。

GPT-5 在科學工作流程中的角色

GPT-5 作為研究夥伴,擴大了探索的範圍,並縮短了從假設到結果所需的時間。它不會自主運作,而是與人類科學家協同工作,由他們定義議程、批判想法並驗證結果。

這些早期實驗中識別的關鍵能力包括:

  • 概念文獻搜尋:模型能夠識別想法之間的深層關聯,並跨不同語言及較不易獲取的來源檢索相關材料,超越關鍵字為基礎的搜尋。
  • 理論推理:在數學與理論計算機科學領域,GPT-5 能在幾分鐘內生成可行的證明大綱,將之前需要數天或數週的工作大幅縮減。
  • 假設生成:在生物學等經驗科學中,模型能針對觀測到的數據提出機制,並設計特定的實驗來在濕實驗室驗證這些假設。
  • 跨領域綜合:模型能將一個領域的形式定理(例如凸幾何)與其他領域的應用連結起來,如密度估計與學習理論。

科學加速案例研究

數學與理論計算機科學

GPT-5 已貢獻於解決開放問題並精煉理論界限:

  • Erdős 問題:研究者 Mehtaab Sawhney 和 Mark Sellke 使用 GPT-5 解決了 Erdős 問題 #848。該模型提供了一個關鍵見解,說明單個「格格不入」的數字如何限制集合的其餘部分,這成為最終證明的缺失步驟。
  • 凸優化:Sébastien Bubeck 使用該模型來改進有關梯度下降的定理。GPT-5 提出了更嚴格的步長界限和更乾淨的證明,Bubeck 以手動方式驗證了該證明。
  • 線上演算法:Christian Coester 利用 GPT-5 為凸體追蹤問題構思困難實例,從而得到比先前已知更強的競爭比例下界。
  • 圖論:該模型為樹狀結構中的兩個不等式生成了簡潔優雅的證明,其中一個之前僅被猜測。

生物學與免疫學

在 Derya Unutmaz 醜博士領導的研究中,GPT-5 分析了未公開的流式細胞術散點圖,以識別人類免疫細胞中令人困惑的變化的機制。該模型指出, priming 期間 N-連接糖基化的中斷是驅動因素,並提出了「甘露醇救援實驗」來證實此點。實驗室現有的數據完全符合模型的預測。

物理與宇宙學

  • 黑洞對稱性:在獲得平面空間的「熱身」問題後,GPT-5 Pro 重建了 Kerr 黑洞波動方程式隱藏的 SL(2,ℝ) 對稱代數,與人類推導的結果相符。
  • 宇宙學模型:Robert Scherrer 使用該模型來理性檢驗推導,並在不同的暗能量參數化之間進行翻譯,減少代數錯誤。
  • 聚變與等離子體物理:該模型協助構建了熱核燃燒傳播的簡化物理模型,並識別了燃燒前緣的最佳密度分布。

技術限制與需求

儘管取得了這些成功,OpenAI 強調,由於若干持續的失敗模式,專家監督是必須的。

  • 幻覺:GPT-5 能生成看似合理但實際錯誤的引用、機制或證明。
  • 歸屬差距:在涉及避免碼團的編碼案例中,模型複製了先前研究論文中的正確論點但未標註來源,只有在新會話中被明確詢問時才識別出原始工作。
  • 敏感度:模型的表現可能對「支架」(問題的框架方式)以及使用「熱身」問題來啟動其推理敏感。
  • 推理錯誤:如果未經人類專家糾正,它可能會追隨無生產力的推理路線。

未來發展軌跡

OpenAI 認為 GPT-5 的當前能力是一個基線,將隨著計算量和推理時間的增加而提升。該實驗室預期,如果模型能在 20 分鐘內協助解決研究問題,則在允許模型花費數小時或數天來推理複雜問題時,將會產生更深層的成果。

Sources