harbor-framework/terminal-bench-science

Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains

何を解決するか

Terminal-Bench-Science は、実際の科学的調査ワークフローを標準化された方法で測定するための仕組みを提供します。生命科学、物理学、地球科学、数学、工学などの科学分野における専門的・エキスパートレベルのタスクと、一般のAI能力とのギャップを埋めます。

どう動くか

このプロジェクトは、専門家がキュレートしたタスクから構成される継続的なベンチマークであり、ターミナル環境で客観的に検証されます。Harbor フレームワークを使用して、エージェントがこれらのタスクに挑戦するように設定されています。コミュニティ主導のパイプラインを通じて、分野の専門家がタスクを提案・構築・レビューし、最先端のAIモデルにとって常に挑戦的で関連性のある状態を維持します。

対象は誰か

このベンチマークは、エージェントを開発するAI研究者、およびAIシステムが実際に支援すべき業務を反映したタスクを貢献したい科学分野の専門家向けです。

特徴

  • 専門家がキュレート: 5つの広範な科学分野の専門家がタスクを執筆・レビューしています。
  • 客観的に検証可能: すべてのタスクはターミナル環境内で検証可能な結果を生成します。
  • コミュニティ主導: タスクの提案、実装、レビューを透明なパイプラインで行います。
  • 汚染防止: キャニオン文字列を使用して、トレーニングデータパイプラインがベンチマークデータをトレーニングコーパスから検出・除外できるようにしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト