harbor-framework/terminal-bench-science

Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains

解決的問題

Terminal-Bench-Science 提供了一種標準化的方法,用以衡量 AI 代理在處理複雜、真實世界科學研究工作流程方面的表現。它彌補了通用 AI 能力與生命科學、物理科學、地球科學、數學和工程科學等科學領域所需的專門化、專家級任務之間的差距。

如何運作

此專案是一個持續的基準測試,包含由領域專家精心策劃的任務,並在終端環境中進行客觀驗證。它使用 Harbor 框架將代理執行於這些任務上。該基準透過社群驅動的流程不斷演進,領域專家提出、建構並審查任務,以確保其對前沿 AI 模型始終保持挑戰性與相關性。

適用對象

此基準測試專為開發代理的 AI 研究人員,以及希望貢獻真實工作場景任務以支援 AI 系統的科學領域專家而設計。

主要亮點

  • 專家策劃:任務由五個廣泛科學領域的專家撰寫並審查。
  • 客觀可驗證:所有任務均能在終端環境中產生可驗證的結果。
  • 社群驅動:擁有透明的任務提案、實作與審查流程。
  • 防污染機制:使用 Canary 字串幫助訓練資料流水線檢測並排除基準資料,防止其進入訓練語料庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案