mdlARC: 以高樣本效率在 ARC-AGI-1 達到 44%

mdlARC: 以高樣本效率在 ARC-AGI-1 達到 44%\n\n## 概覽\n\nA small transformer model 在測試時從頭開始訓練,在 ARC-AGI-1 基準測試中取得了 44% 的分數,總生命週期計算成本僅為 67 美分。這個結果證明了,即使不依賴大規模預訓練、合成數據或複雜的遞迴迴圈,使用簡單的自回歸 transformer 架構也能實現高樣本效率和抽象推理能力。\n\n## 技術實作\n\n該模型採用測試時訓練 (TTT) 方法,在單張 NVIDIA RTX 5090 上,針對訓練集和評估集謎題(隱藏測試標籤)進行約 1.5 小時的從頭開始訓練。\n\n### 架構與訓練\n- Model Structure: 模型使用現代 transformer 架構,包含 8 層,並將 GELU 替換為 SwiGLU,將 LayerNorm 替換為 RMSNorm。\n- Representations: 系統使用 3D RoPE (Rotary Positional Embeddings) 以及為每個謎題獨立學習的加性嵌入 (additive embedding),以實現跨任務學習。\n- Training Objective: 模型採用監督式訓練,這意味著損失函數僅包含輸出 token,而非同時包含輸入與輸出 token。這項改變將性能從 40% 提升至 44%。\n- Optimization: 模型使用了 NorMuon 優化器,解決了在 vanilla Muon 中觀察到的收斂問題,並採用了 WSD (warmup, hold, linear decay) 學習率排程。\n- Data Augmentation: 輸入測試數據透過顏色和二面體排列 (dihedral permutations) 進行增強。系統會提交這兩種增強輸入所產生的最常見兩種輸出。\n\n### 性能與消融實驗\n實驗結果顯示,表示法 (representation) 是性能的主要驅動力。移除 3D RoPE 或每個任務的嵌入,都會導致分數大幅下降至約 25%。\n\n| Ablation | Score |\n| :--- | :--- |\n| Full Model | 44% |\n| No 3D RoPE | ~24% |\n| No Per-Task Embeddings | ~24% |\n| Training on Inputs | ~39% |\n| ARC-1 + ConceptARC only | ~40% |\n| 1D RoPE instead of 3D | ~24% |\n| CompressARC style (unsupervised, per-task) | ~18% |\n\n## ARC-AGI 基準測試分析\n\n作者認為,目前基於 LLM 的 ARC-AGI 方法往往具有誤導性,因為它們依賴合成數據和大規模的離線預訓練,這可能導致「benchmaxxing」(針對基準測試進行優化)而非開發通用的抽象推理能力。\n\n### 合成數據的角色\n合成數據被批評為降低了破解謎題所需的流體智力門檻。作者建議禁止離線預訓練,並要求模型在提交後從頭開始訓練,以確保不使用合成數據,並使不同模型類型的比較更加公平。\n\n### Transductive Reasoning 與 TTT\n對於在訓練中使用評估謎題的輸入,存在著顯著的爭議。作者辯護稱這是一種「轉導式推理」(transductive reasoning),認為在元學習 (meta-learning) 基準測試中,AI 應該被允許從評估謎題的可用上下文 (context) 中學習,只要最終的測試標籤保持隱藏即可。\n\n## 與其他方法的比較\n\n### Recursion vs. Simple Transformers\n雖然近期表現優異的模型如 TRM 和 HRM 強調遞迴迴圈 (recursive loops) 和深度監督,但 mdlARC 的結果顯示,無需遞迴即可達到類似的性能。作者認為,遞迴的益處可能主要在於增加計算量而不增加記憶體移動。\n\n### LLM 限制\n對 LLM 在 ARC-AGI 上的進展觀察顯示,性能提升主要由合成數據的後訓練 (post-training) 所驅動。這方面的證據包括:基礎模型在 ARC-2 上的分數往往維持在個位數,且 ARC-2 的進展往往反映的是可用合成數據的量,而非通用推理能力的提升。\n\n## 社群洞察與反對意見\n\n研究人員與從業者之間的討論突顯了關於此方法有效性與實用性的幾個關鍵點:\n\n> "The '67 cents' part though is misleading imho. You can't extrapolate from there and think that investing say $100 will get you a lot better results. You hit a ceiling very fast and investing into more compute will give you diminishing results.",\n\n> "If the exam was adjusted so that you can only look at one question at a time, you won't get 44% anymore.",\n\n\n\nCritics 點出,同時對所有測試任務進行訓練可能無法真實反映現實世界的問題解決能力,儘管作者指出,這與基準測試組織者比較 TRM 等模型的方式是一致的。

Sources

相關