harbor-framework/terminal-bench-science
Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains
解決的問題
Terminal-Bench-Science 提供了一種標準化的方法,用以衡量 AI 代理在處理複雜、真實世界科學研究工作流程方面的表現。它彌補了通用 AI 能力與生命科學、物理科學、地球科學、數學和工程科學等科學領域所需的專門化、專家級任務之間的差距。
如何運作
此專案是一個持續的基準測試,包含由領域專家精心策劃的任務,並在終端環境中進行客觀驗證。它使用 Harbor 框架將代理執行於這些任務上。該基準透過社群驅動的流程不斷演進,領域專家提出、建構並審查任務,以確保其對前沿 AI 模型始終保持挑戰性與相關性。
適用對象
此基準測試專為開發代理的 AI 研究人員,以及希望貢獻真實工作場景任務以支援 AI 系統的科學領域專家而設計。
主要亮點
- 專家策劃:任務由五個廣泛科學領域的專家撰寫並審查。
- 客觀可驗證:所有任務均能在終端環境中產生可驗證的結果。
- 社群驅動:擁有透明的任務提案、實作與審查流程。
- 防污染機制:使用 Canary 字串幫助訓練資料流水線檢測並排除基準資料,防止其進入訓練語料庫。
相關
- 專案
- 專案
- 專案
- 專案
- 專案