harbor-framework/terminal-bench

Measuring and evolving with the frontier of agent work

解決的問題

Terminal-Bench 是一個專為衡量前沿 AI 代理能力而設計的基準測試。它提供一組多樣且具挑戰性的高品質任務,這些任務會隨著時間不斷演進,讓代理開發者能追蹤進展,並比較不同代理與模型的表現。

作法

基於 Harbor 框架建構,此基準測試由一組可在沙盒環境(例如 Modal)中執行的任務資料集組成。使用者可透過指定要使用的代理與模型,並使用 Harbor CLI 工具執行基準測試。專案透過標籤式發布與公開排行榜,維持持續的基準測試。

適用對象

適合希望評估其代理處理複雜、現實世界中基於終端任務能力的前沿 AI 代理開發者。

主要亮點

  • 具有持續進化的任務,防止效能停滯。
  • 與 Harbor 框架整合,實現標準化執行。
  • 支援沙盒環境,確保安全且可靠的代理執行。
  • 提供公開排行榜,用於比較代理與模型的表現。

相關

  • 專案
  • 專案
  • 專案
  • 專案