OpenAI 推出 LifeSciBench 以評估生命科學領域的具代理性 AI
OpenAI 推出 LifeSciBench 以評估生命科學領域的具代理性 AI
OpenAI 推出了 LifeSciBench,一項旨在評估 AI 系統是否能支援真實的生命科學研究任務的基準。與傳統僅聚焦於狹窄領域或單一技能的評估不同,LifeSciBench 評估模型處理現實研究複雜性的能力,包括解讀不完整的證據、調和相互矛盾的結果,以及在不確定性下設計實驗。
基準組成與分類
LifeSciBench 包含 750 個由專家撰寫的任務,涵蓋七個生物領域與七個核心研究工作流程。這些工作流程是透過調查在職生命科學家,以確定應用研究環境中最常見的活動而確定的:
- 證據處理:從各種來源提取、調和與審核科學證據。
- 分析
- 設計與最佳化
- 驗證與運營
- 翻譯:藥物開發的「實驗台到臨床」過程。
- 科學推理
- 科學傳達
為了反映研究的實務性,基準包含 1,062 個任務工件,例如 PDF、圖表、表格、序列檔案與化學結構檔案。超過一半(53%)的任務要求模型從至少一個此類工件中綜合資訊。
資料集建構與專家驗證
LifeSciBench 由 173 位具博士級訓練且在生物技術或製藥產業擁有經驗的科學家開發。建構過程強調科學基礎與嚴謹性:
- 迭代審查:被接受的任務平均經過六輪自動審查循環,且至少進行兩輪專家審查。
- 共識:審查以可驗證的正確答案或強大的專家共識為基礎,要求相關領域的審查者至少有 90% 的一致性。
- 獨立驗證:此基準進一步由 453 位獨立審查者驗證(其中 97% 擁有博士或同等學歷)。這些審查者在包括與實務工作對齊以及評估模型表現的有用性等類別上報告超過 96% 的一致性。
評分方法論:細緻評分標準
由於生命科學任務往往缺乏唯一的「正確」答案,LifeSciBench 使用詳細、針對任務的評分標準,而非簡單的二元評分。此基準使用共 19,020 項標準(平均每任務 25 項)來評估科學正確性與操作實用性。
此方法使基準能夠獎勵部分正確性。模型可能得到正確的高層結論,但因忽略關鍵檢測限制或生物細節而被扣分。相反地,即使模型未完全解決任務,只要推理品質高,也可獲得部分分數。
模型表現與能力
OpenAI 使用兩項指標評估此基準:通過率(達到 70% 成功門檻的任務比例)與 分數(平均評分標準的獎勵)。
優勢領域
前沿模型在科學綜合、傳達與結構化解讀方面展現最大進步。GPT‑Rosalind 的整體精確通過率較 GPT‑5.5 提升,從 25.7% 上升至 36.1%。
- 科學傳達:通過率從 56.3%(GPT‑5.5)提升至 71.1%(GPT‑Rosalind)。
- 翻譯:通過率從 36.8%(GPT‑5.5)提升至 57.7%(GPT‑Rosalind)。
- 專家可用輸出:GPT‑Rosalind 在需要可操作輸出的任務上得分 44.7%,而 GPT‑5.5 為 29.1%。
劣勢領域
AI 系統仍在處理大量工件與操作受限的工作時遇到困難:
- 工件整合:當引入工件時,通過率顯著下降。GPT‑Rosalind 在僅文字任務的通過率為 45.1%,而在涉及工件或 URL 的任務上降至 28.1%。
- 設計與分析:「設計、最佳化與預測」(通過率 30.7%) 與「分析」(通過率 30.3%) 仍是 GPT‑Rosalind 最具挑戰性的工作流程。
- 精確輸出:模型在需要精確序列、結構或數值輸出的任務上表現不佳。GPT‑Rosalind 在數值任務上僅達 14.8%,在序列或結構輸出上為 24.0%。
限制與未來方向
LifeSciBench 衡量的是任務層面的能力,而非下游研究影響的直接指標。它聚焦於獨立任務,未能捕捉實際研究的迭代性——在新證據出現時修正假設的過程。
OpenAI 表示,下一階段的開發將把這些基準結果與實際研究工作流程的部署研究相結合,以判斷 AI 系統是否真的能在更長的時間範圍內加速發現或提升研發成果。
Sources
- OriginalIntroducing LifeSciBench