harbor-framework/terminal-bench

Measuring and evolving with the frontier of agent work

何を解決するか

Terminal-Bench は、先端 AI エージェントの能力を測定するためのベンチマークです。時間とともに進化する多様で困難な高品質なタスクのセットを提供し、エージェント開発者が進捗を追跡し、異なるエージェントやモデルのパフォーマンスを比較できるようにします。

動作方法

Harbor フレームワークに基づいて構築されており、サンドボックス環境(例:Modal)で実行可能なタスクのデータセットで構成されています。ユーザーはエージェントとモデルを指定して、Harbor CLI ツールを使ってベンチマークを実行できます。プロジェクトはタグ付きリリースと公開リーダーボードを維持することで、継続的なベンチマークを提供しています。

対象ユーザー

複雑で現実世界のターミナルベースのタスクを処理できる能力を評価したい先端 AI エージェント開発者向けです。

特徴

  • 時間とともに進化するタスクによる継続的なベンチマークで、停滞を防ぎます。
  • 標準化された実行を可能にする Harbor フレームワークとの統合。
  • エージェントの安全な実行を保証するサンドボックス環境のサポート。
  • エージェントとモデルのパフォーマンスを比較できる公開リーダーボード。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト