benchflow-ai/skillsbench

SkillsBench evaluates how well skills work and how effective agents are at using them.

何を解決するか

SkillsBenchは、AIエージェントが「スキル」——つまり、指示、スクリプト、リソースのモジュール化されたコレクション——をどのように活用し、組み合わせて専門的なワークフローを実行できるかを評価する必要に対応しています。特に、現在の最先端モデルが困難とされる複雑なタスクを解決するために、複数のスキルを組み合わせる能力に焦点を当てています。

仕組み

このプロジェクトは、エージェントの行動とスキルの有効性を測定するための、gymスタイルのベンチマークアプローチを使用しています。タスクは task.md パッケージとして定義され、Dockerによる環境、ベースラインソリューションのオラクル、エージェント出力の検証用の検証者を含みます。BenchFlow SDKと統合されており、Modalを介したクラウドサンドボックスまたはローカルDocker環境での実行をサポートしています。

対象ユーザー

AI研究者やAIエージェントの開発・テストに取り組む開発者向けに設計されており、特にモジュール化されたスキル習得や複雑なタスクの組み合わせに注力している人々に適しています。

特徴

  • スキルの組み合わせに特化:2つ以上のスキルを組み合わせて解決する必要があるタスクを特に設計しています。
  • gymスタイルのベンチマーク:エージェントのパフォーマンスと行動を構造的に評価する方法を提供します。
  • 柔軟な実行環境:Modalを介したクラウド実行とDockerを介したローカル実行の両方をサポートしています。
  • 拡張可能なタスクシステム:ユーザーが定義された環境、オラクル、検証者を持つ新しいタスクを作成できるようにしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト