harbor-framework/terminal-bench
Measuring and evolving with the frontier of agent work
解決的問題
Terminal-Bench 是一個專為衡量前沿 AI 代理能力而設計的基準測試。它提供一組多樣且具挑戰性的高品質任務,這些任務會隨著時間不斷演進,讓代理開發者能追蹤進展,並比較不同代理與模型的表現。
作法
基於 Harbor 框架建構,此基準測試由一組可在沙盒環境(例如 Modal)中執行的任務資料集組成。使用者可透過指定要使用的代理與模型,並使用 Harbor CLI 工具執行基準測試。專案透過標籤式發布與公開排行榜,維持持續的基準測試。
適用對象
適合希望評估其代理處理複雜、現實世界中基於終端任務能力的前沿 AI 代理開發者。
主要亮點
- 具有持續進化的任務,防止效能停滯。
- 與 Harbor 框架整合,實現標準化執行。
- 支援沙盒環境,確保安全且可靠的代理執行。
- 提供公開排行榜,用於比較代理與模型的表現。
相關
- 專案
- 專案
- 專案
- 專案