pathwaycom/arc-task-gen
Generates original ARC-AGI-1-style tasks distribution-matched to the public eval set.
해결하는 문제
이 프로젝트는 AI 벤치마크의 데이터 오염 문제를 해결합니다. 공개된 ARC-AGI-1 데이터셋은 널리 사용되고 있기 때문에, 모델이 실제로 추론을 하고 있는 것인지 아니면 단순히 훈련 중에 본 태스크를 회상하고 있는 것인지 판단하기 어렵습니다. 이 도구는 공개 데이터셋과 유사하지만 모델이 본 적 없는 분포 일치형 태스크를 생성하여, few-shot 규칙 유도 능력에 대한 보다 정직한 평가를 가능하게 합니다.
작동 방식
이 도구는 표준 ARC 형식(훈련 및 테스트 쌍을 포함하는 tasks.json 파일)으로 프라이빗 평가 태스크 세트를 생성합니다. 생성된 태스크는 기존 ARC-AGI-1 데이터셋과 동일한 속성을 유지하므로, 기존 평가 하네스와 호환되면서도 모델이 새로운 문제에 대해 테스트되도록 보장합니다.
대상
BDH-CQ 아키텍처와 같은 추론 모델을 구축하는 연구자 및 개발자 중, ARC-AGI-1 벤치마크에서의 모델 성능이 암기가 아닌 실제 추론에 의한 것임을 검증해야 하는 분들을 위한 도구입니다.
주요 특징
- 분포 일치: 공개된 ARC-AGI-1 세트의 특성을 반영하는 태스크를 생성합니다.
- 벤치마크 호환성: 기존 도구와 쉽게 통합할 수 있도록 표준 ARC JSON 형식으로 출력을 생성합니다.
- 오염 방지: few-shot 규칙 유도를 격리하기 위한 프라이빗 평가 세트를 생성하는 방법을 제공합니다.
- 독립적 검증: Transformer 아키텍처의 공동 저자를 포함한 전문가들에 의해 독립적으로 재현된 BDH-CQ 모델을 평가하는 데 사용되었습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트