mdlARC: 테스트 시점에서의 고 샘플 효율성으로 ARC-AGI-1에서 44% 달성
개요
테스트 시점에서 처음부터 학습된 소규모 트랜스포머 모델이 총 수명 동안 67센트의 계산 비용으로 ARC-AGI-1 벤치마크에서 44%의 점수를 기록했다. 이 결과는 거대한 사전 학습, 합성 데이터, 또는 복잡한 재귀 루프에 의존하지 않고도 간단한 순차적 트랜스포머 아키텍처를 통해 높은 샘플 효율성과 추상적 추론 능력을 달성할 수 있음을 보여준다.
기술적 구현
모델은 소규모 트랜스포머를 테스트 세트 퍼즐(테스트 레이블은 숨김)과 학습 세트 퍼즐에 대해 처음부터 약 1.5시간 동안 단일 NVIDIA RTX 5090에서 훈련하는 테스트 시점 학습(TTT) 방식을 사용한다.
아키텍처 및 훈련
- 모델 구조: 8층의 현대적 트랜스포머 아키텍처를 사용하며, GELU 대신 SwiGLU, LayerNorm 대신 RMSNorm을 사용한다.
- 표현 방식: 3D RoPE(Rotary Positional Embeddings)와 각 퍼즐에 대해 별도로 학습된 가산 임베딩을 사용하여 태스크 간 학습을 가능하게 한다.
- 훈련 목적: 모델은 지도 학습 방식으로 훈련되며, 손실 함수에는 입력 토큰과 출력 토큰 모두가 포함되지 않고 출력 토큰만 포함된다. 이 변경으로 성능이 40%에서 44%로 향상되었다.
- 최적화: Vanilla Muon에서 관찰된 수렴 문제를 해결한 NorMuon 최적화기와 WSD(워밍업, 유지, 선형 감소) 학습률 스케줄을 사용한다.
- 데이터 증강: 입력 테스트 데이터는 색상과 이면 대칭 변환을 통해 증강된다. 이러한 증강된 입력에서 생성된 두 가지 가장 흔한 출력을 제출한다.
성능 및 제거 실험
실험 결과는 표현 방식이 성능의 주요 결정 요인임을 보여준다. 3D RoPE나 태스크별 임베딩을 제거하면 점수가 급격히 약 25%로 떨어진다.
| 제거 실험 | 점수 |
|---|---|
| 전체 모델 | 44% |
| 3D RoPE 없음 | ~24% |
| 태스크별 임베딩 없음 | ~24% |
| 입력만으로 훈련 | ~39% |
| ARC-1 + ConceptARC만 | ~40% |
| 1D RoPE로 대체 | ~24% |
| CompressARC 스타일(비지도, 태스크별) | ~18% |
ARC-AGI 벤치마킹 분석
저자는 현재 LLM 기반의 ARC-AGI 접근 방식이 합성 데이터와 거대한 오프라인 사전 학습에 의존함으로써 일반적인 추상적 추론 개발보다는 "벤치마크 최적화(benchmaxxing)"에 치우쳐 있다고 주장한다.
합성 데이터의 역할
합성 데이터는 퍼즐을 해결하기 위해 요구되는 유동적 지능의 기준을 낮춘다고 비판받는다. 저자는 오프라인 사전 학습을 금지하고, 제출 후 처음부터 학습하도록 요구함으로써 합성 데이터 사용을 방지하고, 다양한 모델 유형 간 공정한 비교를 보장할 것을 제안한다.
전도적 추론과 TTT
평가 퍼즐 입력을 훈련에 사용하는 것에 대해 큰 논쟁이 있다. 저자는 이를 "전도적 추론"이라고 정당화하며, 메타학습 벤치마크에서는 평가 퍼즐의 가용한 맥락에서 학습할 수 있도록 허용해야 한다고 주장한다. 단, 최종 테스트 레이블은 숨겨져 있어야 한다.
다른 접근 방식과의 비교
재귀 vs. 단순 트랜스포머
최근 높은 성능을 기록한 모델들인 TRM과 HRM은 재귀 루프와 깊은 지도 학습을 강조하지만, mdlARC의 결과는 재귀 없이도 유사한 성능을 달성할 수 있음을 시사한다. 저자는 재귀의 이점이 주로 메모리 이동 없이 계산량을 늘리는 데에 있다고 주장한다.
LLM의 한계
ARC-AGI에서 LLM의 발전을 관찰한 결과, 성능 향상은 주로 합성 데이터에 대한 사후 훈련에 의해 주도된다는 것이 드러났다. 이를 뒷받침하는 증거로, 기본 모델은 종종 ARC-2에서 단일 자릿수 점수를 유지하며, ARC-2에서의 진전은 일반적인 추론 능력의 향상보다는 합성 데이터의 양과 일치하는 경향이 있다.
커뮤니티의 통찰과 반론
연구자들과 전문가들 사이의 논의에서 이 접근 방식의 타당성과 유용성에 대해 몇 가지 핵심 포인트가 제기되었다:
"67센트라는 부분은 개인적으로 오해의 소지가 있다고 생각합니다. 거기서부터 추론해서 100달러를 투자하면 훨씬 더 좋은 결과가 나올 것이라고 생각하면 안 됩니다. 매우 빠르게 한계에 도달하고, 더 많은 계산 자원을 투자해도 성능 향상은 점점 줄어듭니다."
"시험 문제가 한 문제씩만 볼 수 있도록 조정된다면, 더 이상 44%를 달성할 수 없을 것입니다."
비판자들은 모든 테스트 태스크를 동시에 훈련하는 것이 현실 세계의 문제 해결 방식과 비현실적이라고 지적했지만, 저자는 이는 벤치마크 운영자들이 TRM 같은 모델들을 비교할 때 사용하는 방식과 일치한다고 지적한다.
Sources
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch