arcprize/arc-agi-benchmarking

Testing baseline LLMs performance across various models

What it solves

このプロジェクトは、ARC-AGI (Abstraction and Reasoning Corpus) タスクにおけるAIモデルのベンチマーク測定のための標準化されたフレームワークを提供します。これにより、さまざまなモデルプロバイダーにわたってこれらの複雑な推論タスクを実行するプロセスを簡素化し、APIのレート制限、リトライ、およびパフォーマンス・スコアリングの運用オーバーヘッドを処理します。

How it works

このシステムは、一連のモデルアダプターを使用して、さまざまなAIプロバイダー(OpenAI、Anthropic、Gemini、Grokなど)とインターフェースします。ユーザーはYAMLファイルでモデル構成を定義し、temperatureやtoken limitsなどのパラメータを指定します。ベンチマークツールは、その後、ARC-AGIデータセットのタスクを実行し、複数の構成にわたる並行リクエストを管理し、生のAPIインタラクションをログに記録します。最後に、専用のスコアリングスクリプトが、モデルが生成した出力を正解(ground-truth)と比較して、精度を計算します。

Who it’s for

ARC-AGIベンチマークを使用してLLMの汎用的な知能と推論能力を評価したいAI研究者や開発者向けに設計されています。

Highlights

  • Multi-Provider Support: OpenAI、Anthropic、Gemini、Fireworks、Grokを含む幅広いプロバイダー向けの組み込みアダプター。
  • Robust Execution: レート制限、tenacityベースのリトライ、および効率的なバッチ処理のためのasyncioが組み込まれています。
  • Scalable Benchmarking: 共有プロバイダーのレート制限内で、異なるデータセットにわたって複数のモデル構成を並行して実行する能力。
  • Detailed Logging: モデルの推論とリクエスト履歴を追跡するために、すべてのタスクに対して生のAPI JSONLログを自動生成します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト