使用 BioMysteryBench 評估 Claude 的生物資訊學研究能力
Anthropic 發展了 BioMysteryBench,這是一個新的生物資訊學基準,旨在評估 AI 模型是否能使用真實世界資料集解決複雜且開放式的研究問題。評估結果顯示,Claude 的科學能力正隨著世代快速提升,最新模型的表現已與人類專家相當,並解決了多個人類專家小組無法解決的問題。
評估生物資訊學研究的挑戰
評估科學 AI 非常困難,因為傳統基準往往無法捕捉真實研究中混亂且開放式的本質。Anthropic 指出,建立標準科學基準面臨三大主要障礙:
- 方法多樣性: 在生物學中,根據研究者的背景和可用資源,往往存在多種「正確」的問題解決方式。
- 主觀性與雜訊: 生物學資料集通常雜訊較多,微小的主觀研究決策差異可能導致完全不同的結論。
- 人類知識缺口: 最具影響力的研究任務正是人類尚未解決的問題,因此無法單靠人類表現作為唯一真實標準。
BioMysteryBench:科學的可驗證框架
BioMysteryBench 包含由各個生物資訊學領域專家撰寫的 99 個問題。為克服上述評估挑戰,該基準採用四項關鍵特性:
- 方法無關評分: Claude 的評分基於最終答案,而非所採用的具體分析路徑,從而允許研究上的創造力。
- 客觀真實答案: 答案源自資料的可控特性或經過驗證的元資料(例如 PCR 測試),而非主觀的科學結論。
- 超越人類的問題生成: 由於答案基於資料特性,該基準包含了一些客觀上可解但人類專家難以解決的問題。
- 工具支援環境: Claude 被置於包含標準生物資訊學工具的容器中,可透過 pip 和 conda 安裝新工具,並存取 NCBI 和 Ensembl 等資料庫。
問題主要聚焦於 DNA 和 RNA 定序資料(WGS、scRNA-seq、甲基化、ChIP-seq、宏基因組學、Hi-C),以及蛋白質組學和代謝組學。
性能比較:AI 與人類專家
Anthropic 透過指派最多五位領域專家回答每個問題來建立基準。這將任務分為兩類:
人類可解任務
在至少有一位人類能解決的 76 個任務中,Claude 表現出色,經常與人類策略一致。在某些情況下,Claude 使用「直覺」識別模式或序列——類似於 TATA box 的發現方式——這與傳統的演算法方法不同。
人類困難任務
在剩餘 23 個專家無法解決的問題中,Claude Sonnet 4.6 及更先進的模型解決了相當比例。Claude Mythos Preview 在這些人類困難問題上達到了 30% 的解決率。
Claude 研究策略分析
對 Opus 4.6 的對話紀錄分析揭示了兩種主要策略,使 Claude 在困難任務上超越人類:
- 「全知」方法: Claude 借助其內部龐大的結構生物學、分子輪廓和數十萬篇論文的綜合分析知識,解決原本需要人類手動整合多個資料庫才能完成的問題。
- 證據疊加: 當不確定時,Claude 會疊加多種不同方法,並收斂至多個證據線支持的答案。
可靠性與能力邊界
使用 Claude Mythos Preview 分析資料後,Anthropic 發現兩組「勝利」在可靠性上存在明顯差異:
- 可靠勝利: 在人類可解問題上,Opus 4.6 在至少 4/5 次中成功解決其成功問題的 86%,顯示出可靠的解決方法。
- 脆弱勝利: 在人類困難問題上,「脆弱勝利」(僅在 1-2 次中成功)的比例躍升至 44%。
這表明,雖然模型能破解最困難的問題,但往往依賴「幸運」的推理路徑,而非可持續重複的解決方案。
產業趨同與未來展望
Anthropic 指出,這些結果與 Genentech 和 Roche 發布的類似基準 CompBioBench 相呼應。在該評估中,Claude Opus 4.6 總體準確率達到 81%,在最困難問題上達 69%,進一步強化了前沿模型在生物資訊學研究中作為有用協作者的角色。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch