mdlARC: 高いサンプル効率で ARC-AGI-1 において 44% を達成

概要

テスト時にゼロから学習された小型のトランスフォーマーモデルが、総生涯計算コストわずか 67 セントで ARC-AGI-1 ベンチマークにおいて 44% のスコアを達成しました。この結果は、大規模な事前学習や合成データ、複雑な再帰ループに頼ることなく、単純な自己回帰トランスフォーマーアーキテクチャを使用して、高いサンプル効率と抽象的な推論能力を達成できることを示しています。

技術的実装

このモデルは、テスト時学習(TTT)アプローチを採用しており、単一の NVIDIA RTX 5090 上で約 1.5 時間、トレーニングセットと評価セットの両方のパズルを(テストラベルは隠された状態で)ゼロから学習します。

アーキテクチャと学習

  • モデル構造: モデルは 8 層のモダンなトランスフォーマーアーキテクチャを使用しており、GELU を SwiGLU に、LayerNorm を RMSNorm に置き換えています。
  • 表現形式: システムは 3D RoPE (Rotary Positional Embeddings) と、タスク間の学習を可能にするために各パズルに対して個別の学習済み加算埋め込みを使用します。
  • 学習目的関数: モデルは教師あり学習でトレーニングされます。つまり、損失関数には入力トークンと出力トークンの両方ではなく、出力トークンのみが含まれます。この変更により、パフォーマンスが 40% から 44% に向上しました。
  • 最適化: モデルは、バニラな Muon で観察された収束の問題を解決した NorMuon オプティマイザと、WSD (warmup, hold, linear decay) 学習率スケジュールを利用しています。
  • データ拡張: 入力テストデータは、色と二面体変換によって拡張されます。これらの拡張された入力から生成された最も一般的な 2 つの出力を提出します。

パフォーマンスとアブレーション研究

実験結果は、表現形式がパフォーマンスの主な要因であることを示しています。3D RoPE またはタスクごとの埋め込みのいずれかを取り除くと、スコアは急激に約 25% まで低下しました。

Ablation Score
Full Model 44%
No 3D RoPE ~24%
No Per-Task Embeddings ~24%
Training on Inputs ~39%
ARC-1 + ConceptARC only ~40%
1D RoPE instead of 3D ~24%
CompressARC style (unsupervised, per-task) ~18%

ARC-AGI ベンチマークの分析

著者は、現在の LLM ベースのアプローチは、合成データへの依存と大規模なオフライン事前学習により、汎用的な抽象推論の開発ではなく「ベンチマーク最大化(benchmaxxing)」につながる可能性があるため、ARC-AGI へのアプローチが誤解を招くことが多いと主張しています。

合成データの役割

合成データは、パズルを解くために必要な流動的知能の基準を下げてしまうとして批判されています。著者は、オフライン事前学習を禁止し、モデルが提出後にゼロから学習することを要求することで、合成データが使用されないことを確実にし、異なるモデルタイプ間での比較を公平にすることを提案しています。

転移的推論と TTT

評価用パズルの入力を使用することに関して、大きな議論があります。著者はこれを「転移的推論(transductive reasoning)」と呼び、メタ学習ベンチマークにおいては、最終的なテストラベルが隠されている限り、評価用パズルの利用可能なコンテキストから学習することが AI には許可されるべきだと主張しています。

他のアプローチとの比較

再帰 vs. 単純なトランスフォーマー

TRM や HRM のような最近の高パフォーマンスなモデルは、再帰ループと深い教師あり学習を強調していますが、mdlARC の結果は、再帰なしでも同様のパフォーマンスに達成可能であることを示唆しています。著者は、再帰の利点は、メモリ移動を増やさずに計算量を増やすことにあると考えています。

LLM の限界

ARC-AGI における LLM の進歩は、主に合成データによる事後学習によって推進されていることが示唆されます。その証拠として、ベースモデルは ARC-2 においてしばしば 1 桁のスコアを維持し、進歩は汎用的な推論能力の向上ではなく、合成データが利用可能である量に比例することが多いという事実が挙げられます。

コミュニティの洞察と反論

研究者や実務家の間での議論では、このアプローチの方式の妥当性と有用性に関して、いくつかの重要なポイントが強調されました。

"67 セントという部分は、個人的には誤解を招くと思います。そこから外挿法を用いて、例えば 100 ドルを投資すればもっと良い結果が得られると考えてしまうことはできません。すぐに天井に達し、計算量へのさらなる投資は収穫逓減となります。"

"もし試験が、一度に一つの質問しか見見ることができないように調整された場合、44% というスコアは得られないでしょう。"

批判的な立場の人からは、テストタスクをすべて同時に学習することは、現実世界の問題解決の現実的な表現ではない可能性も指摘されましたが、著者は、これが TRM のようなモデルを比較するベンチマーク主催者による比較方法と一致していると述べています。

Sources

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch