pathwaycom/arc-task-gen
Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.
解決する課題
このプロジェクトは、AIベンチマークにおけるデータ汚染の問題に対処します。公開されているARC-AGI-1データセットは広く利用可能であるため、モデルが真に推論しているのか、単にトレーニング中に見たタスクを想起しているだけなのかを判断することが困難です。このツールは、公開データセットに似ているがモデルには未知の、分布が一致した新しいタスクを生成し、few-shotのルール誘導能力をより正確に評価することを可能にします。
仕組み
このツールは、標準的なARC形式(トレーニングとテストのペアを含む tasks.json ファイル)で、プライベートな評価用タスクセットを作成します。生成されたタスクは、元のARC-AGI-1データセットと同じ特性を維持しているため、既存の評価用ハーネスと互換性がありながら、モデルが未知の問題でテストされることを保証します。
対象者
BDH-CQアーキテクチャのような推論モデルを構築している研究者や開発者で、ARC-AGI-1ベンチマークにおけるモデルのパフォーマンスが、暗記ではなく真の推論によるものであることを検証する必要がある方々。
特徴
- 分布一致: 公開されているARC-AGI-1セットの特性を反映したタスクを生成します。
- ベンチマーク互換性: 既存のツールと簡単に統合できるように、標準的なARC JSON形式で出力します。
- 汚染なし: few-shotのルール誘導を分離するための、プライベートな評価セットを作成する方法を提供します。
- 独立した検証: Transformerアーキテクチャの共著者を含む専門家によって独立して再現されたBDH-CQモデルの評価に使用されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト