OpenAI 推出 GeneBench-Pro 用於計算生物學推理
OpenAI 推出 GeneBench-Pro 用於計算生物學推理
OpenAI 已推出 GeneBench-Pro,這是一個基準,旨在測試 AI 模型是否能處理真實世界計算生物學所需的判斷密集型、迭代分析。與傳統基準測試事實回顧或預定義工作流程不同,GeneBench-Pro 衡量「研究品味」——處理模糊性、修訂假設並選擇正確分析路徑以達到可決策結果的能力。
量測「研究品味」與科學判斷
GeneBench-Pro 聚焦於限制 AI 在科學研究中表現的系統層面判斷呼叫。該基準將「研究品味」定義為塑造分析的判斷呼叫鏈,包括判斷數據能支持哪些問題以及根據早期診斷知道何時修訂初始計畫。
為了測試這些能力,每個問題會提供模型以下內容:
- 一個真實且雜亂的資料集。
- 簡短的實驗背景。
- 與下游決策相關的目標估計量。
模型必須探索資料、選擇適當的分析方法,並參與迭代實驗過程以提供最終答案。
資料集建構與領域覆蓋
GeneBench-Pro 包含 129 個問題,橫跨基因組學、定量生物學和轉譯醫學的 10 個領域與 21 個子領域。為避免常見的基準失敗——例如任意作者偏好或數值不敏感——OpenAI 採用了合成資料生成。
透過模擬資料生成過程並了解完整的因果結構,OpenAI 確保:
- 主觀分析選擇的合理差異仍能產生被接受的數值結果。
- 看似合理但實際錯誤的分析會失敗。
- 透過詳細的追蹤分析,將資訊洩漏和非預期的解決路徑降至最低。
此外,129 個問題中有 82 個由外部領域專家(包括教授、產業科學家和博士後研究員)進行審核,以驗證真實性、目標答案的可識別性以及方法的適當性。
評估框架與評分
代理在隔離的工作區中進行評估,該工作區配備了標準的生物信息學堆疊,包括 Python、科學計算函式庫以及基本的基因組學套件,如 PLINK 2.0。
由於資料是合成生成的,正確性會根據已知目標進行決定性評分。這消除了經常與基於規則的評估相關的變異性和冗長效應。
OpenAI 將在 Hugging Face 上開源 10 個代表性問題,並將向 Artificial Analysis 提供一個 50 問題的子集,以進行獨立的第三方基準測試。
性能結果與模型比較
GPT-5.6 Sol 是該基準上表現最強的模型,在啟用 Pro 模式下達到 31.5% 的通過率(在最高推理級別為 28.7%)。這相較於原始 GeneBench 有顯著提升,其中最佳前沿模型 GPT-5 的得分低於 5%。
主要發現包括:
- 測試時間計算的擴展: 在最高推理級別,GPT-5.6 Sol 解決的問題數量幾乎是 GPT-5.2 的六倍,而使用的標記數量僅為約三分之二。
- 模型族群差距: GPT 模型在表現上優於領先的開源模型,如 GLM 5.2。OpenAI 指出,在高階科學推理中的表現差距顯著大於編碼基準中的差距,這表明開源模型可能更專注於編碼而非一般推理。
- 與人力成本的比較: 評估者估計,一個典型的 GeneBench-Pro 問題讓人類專家完成需要 20–40 小時。儘管 AI 代理目前仍太不可靠而無法取代專家,但推理成本(幾美元)比估算的人力成本(數千美元)低幾個數量級。
對科學發現的影響
雖然前沿模型仍然只能解決少於三分之一的問題,但它們展示了在具有挑戰性的任務上取得部分進展的能力。OpenAI 認為,目前的失敗模式——進行觀察但難以將其整合到更廣泛的情境中——鏡映了人類新手與專家之間的差異。
如果 AI 代理能可靠地自動化這些分析,則可透過加速假設篩選、目標優先排序以及資料生成與決策之間的迭代循環來轉變工業研究,將科學發現的瓶頸從資料生成轉移到可執行見解的提取。
Sources
- OriginalIntroducing GeneBench-Pro