arcprize/arc-agi-benchmarking

Testing baseline LLMs performance across various models

What it solves

이 프로젝트는 ARC-AGI (Abstraction and Reasoning Corpus) 태스크에 대한 AI 모델 벤치마킹을 위한 표준화된 프레임워크를 제공합니다. 다양한 모델 제공업체에 걸쳐 이러한 복잡한 추론 태스크를 실행하는 프로세스를 단순화하며, API 속도 제한, 재시도, 성능 점수 산정 등의 운영 오버헤드를 처리합니다.

How it works

이 시스템은 다양한 AI 제공업체(OpenAI, Anthropic, Gemini, Grok 등)와 인터페이스하기 위해 일련의 모델 어댑터를 사용합니다. 사용자는 YAML 파일에 temperature와 token limits와 같은 파라미터를 지정하여 모델 구성을 정의합니다. 그런 다음 벤치마킹 도구는 ARC-AGI 데이터셋의 태스크를 실행하고, 여러 구성에 걸쳐 동시 요청을 관리하며, 원시 API 상호작용을 로그로 남깁니다. 마지막으로, 전용 스코어링 스크립트가 모델이 생성한 출력값과 정답(ground-truth) 솔루션을 비교하여 정확도를 계산합니다.

Who it’s for

ARC-AGI 벤치마크를 사용하여 LLM의 일반 지능 및 추론 능력을 평가하고자 하는 AI 연구원 및 개발자를 위해 설계되었습니다.

Highlights

  • Multi-Provider Support: OpenAI, Anthropic, Gemini, Fireworks, Grok을 포함한 광범위한 제공업체에 대한 내장 어댑터를 지원합니다.
  • Robust Execution: 효율적인 배치 처리를 위해 내장된 rate limiting, tenacity-based retries, asyncio를 포함합니다.
  • Scalable Benchmarking: 공유된 제공업체 속도 제한 내에서 서로 다른 데이터셋에 대해 여러 모델 구성을 동시에 실행할 수 있는 능력을 갖추고 있습니다.
  • Detailed Logging: 모델의 추론 및 요청 이력을 추적하기 위해 모든 태스크에 대해 원시 API JSONL 로그를 자동으로 생성합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트