ByteDance-Seed/EdgeBench

EdgeBench: Unveiling scaling laws of learning from real-world environments

何を解決するか

EdgeBenchは、AIエージェントのワンショット性能ベンチマークの限界に対処します。単一の試行を測定するのではなく、実世界の環境との反復的相互作用を通じて、長期間(1タスクあたり最大12時間以上)にわたり学習と改善の能力を評価し、最終結果だけでなく、改善の軌跡を追跡します。

仕組み

EdgeBenchは、6つのカテゴリ(科学・機械学習、システム・ソフトウェア工学、最適化、知識、形式的、ゲーム)にまたがる134の実世界タスクから構成されており、そのうち51タスクは公開されています。専用の評価ハーネスである SForge を使用しており、エージェントが作業を行う「ワーク」コンテナと、テストが実行される隠された「ジャッジ」コンテナの2コンテナ隔離システムを採用しています。エージェントは提出物に対して細かいフィードバックを受け、タイムアウトが発生するまで閉ループで反復できます。

対象ユーザー

自律的なAIエージェントを開発・研究する研究者や開発者向けです。モデルが環境からのフィードバックからどのように学び、時間とともにパフォーマンスを拡張するかを測定したい方におすすめです。

主な特徴

  • 長期間評価: タスク1つあたり12時間以上にわたりエージェントの進捗を追跡。
  • 2コンテナ隔離: ワーク環境とジャッジ環境を分離することで、評価の改ざんを防止。
  • スケーリング法則の発見: エージェントのパフォーマンスが相互作用時間に対して対数シグモイド関数に従うスケーリング法則を発見。
  • SForgeハーネス: Kubernetesバックエンドをサポートするスケーラブルなフレームワークで、大規模なエージェント評価を実現。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト