mdlARC:在测试时以高样本效率实现 ARC-AGI-1 上 44% 的成绩

概述

一个在测试时从零开始训练的小型 Transformer 模型,在 ARC-AGI-1 基准测试中取得了 44% 的分数,总生命周期计算成本仅为 67 美分。这一结果表明,仅使用简单的自回归 Transformer 架构,无需依赖大规模预训练、合成数据或复杂的递归循环,即可实现高样本效率和抽象推理能力。

技术实现

该模型采用测试时训练(TTT)方法,在单个 NVIDIA RTX 5090 上对训练集和评估集谜题(测试标签隐藏)进行约 1.5 小时的从零开始训练。

架构与训练

  • 模型结构:模型采用现代 Transformer 架构,共 8 层,用 SwiGLU 替代 GELU,用 RMSNorm 替代 LayerNorm。
  • 表示方法:系统使用 3D RoPE(旋转位置嵌入)和每个谜题的独立学习加性嵌入,以实现跨任务学习。
  • 训练目标:模型采用监督式训练,损失函数仅包含输出标记,而非输入和输出标记。这一改动使性能从 40% 提升至 44%。
  • 优化方法:模型使用 NorMuon 优化器,解决了原始 Muon 优化器出现的收敛问题,并采用 WSD(预热、保持、线性衰减)学习率调度策略。
  • 数据增强:输入测试数据通过颜色和二面体排列进行增强。从这些增强输入中产生的两个最常见输出被提交。

性能与消融实验

实验结果表明,表示方法是性能的主要驱动因素。移除 3D RoPE 或每任务嵌入均导致分数急剧下降至约 25%。

消融实验 分数
完整模型 44%
无 3D RoPE ~24%
无每任务嵌入 ~24%
仅在输入上训练 ~39%
仅 ARC-1 + ConceptARC ~40%
使用 1D RoPE 替代 3D ~24%
CompressARC 风格(无监督,每任务) ~18%

对 ARC-AGI 基准测试的分析

作者认为,当前基于 LLM 的 ARC-AGI 方法往往具有误导性,因为其过度依赖合成数据和大规模离线预训练,可能导致“基准最大化”而非真正发展通用抽象推理能力。

合成数据的作用

合成数据受到批评,因其降低了求解谜题所需的流体智力门槛。作者提议禁止离线预训练,并要求模型在提交后从零开始训练,以确保不使用合成数据,并使不同模型类型之间的比较更加公平。

传导推理与 TTT

关于在训练中使用评估谜题输入存在显著争议。作者为其辩护,称之为“传导推理”,认为在元学习基准中,AI 应被允许从评估谜题的可用上下文中学习,只要最终测试标签保持隐藏即可。

与其他方法的比较

递归与简单 Transformer

尽管近期表现优异的模型(如 TRM 和 HRM)强调递归循环和深度监督,但 mdlARC 的结果表明,无需递归即可达到类似性能。作者认为,递归的主要优势可能在于增加计算量,而不会增加内存移动。

LLM 的局限性

观察 LLM 在 ARC-AGI 上的表现表明,性能提升主要由合成数据的后训练驱动。证据包括:基础模型在 ARC-2 上通常仍保持个位数分数,且 ARC-2 上的进步往往与可用合成数据量相关,而非通用推理能力的提升。

社区见解与反驳观点

研究人员和实践者之间的讨论突出了该方法有效性和实用性的几个关键点:

"但‘67 美分’这部分在我看来具有误导性。你不能由此推断投入 100 美元就能获得显著更好的结果。你很快就会遇到瓶颈,投入更多计算资源只会带来边际收益。"

"如果考试调整为只能一次看一道题,你就再也无法取得 44% 的成绩了。"

批评者还指出,同时训练所有测试任务可能不切实际地反映了现实世界的问题解决过程,尽管作者指出这与基准组织者比较 TRM 等模型的方式一致。

Sources

相关