在具代理AI時代的科學計算 – OpenAI 現場報告

在具代理AI時代的科學計算 – OpenAI 現場報告

現場報告概覽

該報告呈現了一項對八個由代理協助的科學計算專案的探索性研究,主要在生命科學領域,其中五個專案僅使用 Codex,另外三個專案結合使用 Codex 和 Claude Code。

AI 代理展示的關鍵能力

AI 代理降低了工程工作的成本,承擔了繁瑣的實作任務,幫助研究者快速原型化想法,追求先前不切實際的專案,並在長期內維護軟體,從而產生更高效且維護更好的科學軟體。

案例研究亮點

一項案例研究現代化了廣泛使用的 cyvcf2 庫,用於解析基因組數據;GPT‑5.5 取代了該庫的舊版建置與打包系統,使用一個現代化、統一的流程,旨在讓該庫更易於安裝、測試與發布。

現在使用編碼代理,快速開發非常容易;但目前,要在科學領域走得遠,仍然需要專家的指導、理解、品味與細心。 —Brent Pedersen

代理協助開發中的常見主題

在所有專案中,代理使工程勞動不再成為限制,但瓶頸轉移到驗證 AI 代理的輸出,這仍然依賴人類判斷。 代理對具體且範圍明確的請求處理得很好,但無法可靠地判斷科學有效性或符合期望,即使他們的工作包含明顯錯誤,也常常表現出信心。 因此,人類審查者需要可靠的驗證方法,例如外部參考或可衡量的接受標準(精確的輸出一致性、與現有工具的平行性、適當的統計行為,或使用模擬數據預先建立的答案)。 專案透過回饋驅動的迭代分階段進行:廣泛的目標被拆分為較小的變更,中間基準和測試系統評估並改進代理的工作,儘管代理能快速產出初步實作,但解決邊界情況和微細的數值差異需要更長時間,而「最後一哩」通常需要最多的努力。

驗證與維護的挑戰

貢獻者一致描述研究者的角色從實作轉向驗證與協調:明確要建構什麼、定義如何衡量正確性、決定專案何時準備好發布,同時仍保持對科學方向和質量標準的控制。 報告指出,建立結果工具明確且長期的責任與維護仍是一個持續的挑戰。

對持久科學軟體的影響

長期維護至關重要,因為研究軟體中的維護落差會減慢迭代,限制可重現性和可靠性,且已發表的研究顯示,研究代碼經常無法如文件所述安裝或運行,迫使研究者花費大量時間在配置與除錯上。 較低的實作成本使得產出許多類似的重寫變得更容易,這可能導致使用者分散,並分散維持任何一個工具可靠所需的專家注意力;因此,成熟的科學軟體需要明確的擁有者和可信的維護計畫。 案例研究說明了可能的前進路徑:MHCflurry 和 cyvcf2 的變更被併入他們的原始上游專案,而 rustar‑aligner 則因原始專案已被遺棄而轉移到新的社區維護下。 當可以協調現有維護者時,應該盡早開始;當需要獨立實作時,需要明確的擁有者和可信的維護計畫。 若缺乏這樣的維護,今天的現代重寫可能會變成明日的被遺棄代碼,而非可靠的科學基礎設施。

朝著更持久的科學軟體前進

此現場報告具有回顧與探索性,但案例研究指出科學軟體開發方式正在發生實際的轉變:像 Codex 這樣的編碼代理可以顯著降低維護、遷移、優化及新實作的成本。 他們的長期科學價值仍然取決於人類在什麼時候建構、如何驗證以及誰來維護方面的決策。 更深層的改變不僅在於研究者能產出更多軟體,而在於他們能將更多精力放在定義、驗證和維護工具上。 這些案例研究表明,代理已經能夠加速科學計算中的迭代步伐,隨著編碼代理的改進,研究者將能花費較少時間維持分析管道運行,而將更多時間用於推進他們的領域。

Sources