OpenAI GPT-6 Astra ARC-AGI-3 벤치마크 성능

OpenAI의 GPT-6 Astra는 ARC-AGI-3 벤치마크에서 최첨단(state-of-the-art) 결과를 달성하며 에이전트 지능(agentic intelligence)의 비약적인 도약을 보여주었습니다. 특화된 Provider Adapter harness를 사용하여, 이 모델은 Semi-Private 테스트 세트에서 99.9%의 점수를 기록했으며, 완료한 레벨의 96%에서 행동 효율성 측면에서 인간의 중앙값(median human baseline)을 능가했습니다.

ARC-AGI-3: 에이전트 지능의 측정

ARC-AGI-3는 현재의 AI와 범용 인공지능(AGI) 사이의 "residual gap"을 측정하기 위해 설계된 벤치마크입니다. 이전 버전들과 달리, ARC-AGI-3는 에이전트가 명시적인 지침 없이 퍼즐을 탐색하고 해결해야 하는 새롭고 추상적인 턴제 환경에서의 에이전트 역량에 초점을 맞춥니다.

이 벤치마크는 지능의 네 가지 주요 구성 요소를 평가합니다:

  • Exploration: 환경과 능동적으로 상호작용하여 정보를 수집합니다.
  • Modeling: 가공되지 않은 관찰 내용을 일반화 가능한 모델로 변환하여 미래 상태를 예측합니다.
  • Goal-setting: 희소한 보상(sparse rewards)만을 사용하여 목표 상태를 식별합니다.
  • Planning and Execution: 목표로 가는 경로를 매핑하고 새로운 데이터에 따라 경로를 수정합니다.

GPT-6 Astra 성능 및 비용

GPT-6 Astra는 다양한 추론 노력(reasoning effort) 수준과 harness configuration 설정에서 높은 성능을 보여주었습니다. 결과에 따르면, 더 높은 추론 노력을 기울일수록 모델이 더 적은 행동으로 게임을 해결하므로, 필요한 모델 호출 횟수가 줄어들어 총 비용이 낮아지는 경우가 많습니다.

성능별 Harness

  • Standard Harness: 이 중립적인 인터페이스는 모델이 자신의 가시적인 노트를 스스로 관리하도록 요구합니다. 이 구성에서 Astra (max)는 Semi-Private 세트에서 $26,098의 비용으로 62.7%의 점수를 기록했습니다.
  • Provider Adapter Harness: 이 harness는 요청 간에 불투명한 추론 상태(opaque reasoning state)를 유지하며 긴 대화에 대해 compaction을 사용합니다. 이 구성에서 Astra (high)는 $18,817의 비용으로 99.9%의 점수를 달성했습니다.

추론 노력 비교

Reasoning effort Standard harness Provider Adapter harness
max 62.7%, $26,098 98.6%, $17,332
xhigh 59.3%, $37,317 98.4%, $18,147
high 54.8%, $40,705 99.9%, $18,817
medium 38.6%, $48,090 98.4%, $19,285
low 17.5%, $38,166 98.0%, $21,298
none 35.2%, $49,791 96.7%, $23,457

핵심 행동 통찰

Astra의 리플레이 분석을 통해 높은 성능에에 기여하는 세 가지 뚜렷렷한 역량을 발견했습니다:

1. 맞춤형 기호적 세계 모델 (Custom Symbolic World Models)

Astra는 게임 상태를 추적하고 행동을 계획하기 위해 즉석에서 대수적 약어(algebraic shorthand)를 개발합니다. 전체 프로그래밍 언어를 사용하는 대신, 좌표, 규칙, 시퀀스를 기록하기 위해 정보 밀도가 높은 압축된 노트를 생성합니다. 예를 들어, 상태를 L8: hub q2 (8↓). Lengths: 14=1…로 기록하거나 계획을 extend8 to3; retract10 to2; shorten8 to1과 같이 기록할 수 있습니다.

2. 인간 수준의 행동 효율성

Astra (max)가 Provider Adapter harness를 사용할 때, 레벨의 96.0%에서 중앙값의 인간보다 더 적은 행동을 사용했으며, 레벨당 평균적으로 51.7% 더 적은 행동을 수를를 사용했습니다. 이는 모델이 환경의 메커니즘을 이해한 후에는 인간의 성능에 필치하거나 이를 능가하는 효율성으로 솔루션을 실행한다는 것을 나타냅니다.

3. 자율적 도구 생성

코드 실행 샌드박스를 제공하는 PRO-LONG harness에서 평가되었을 때, Astra는 특정 게임을 위한 맞춤형 소프트웨어 라이브러리를 생성했습니다. 미로 형태의 게임(tu93)에서, Astra는 탐색(maze_solver.py), 전투 규칙(combat_solver.py), 그리고 순찰 모델링(patrol_solver.py)을 위한 별도의 Python 스크립트를 개발했으며, 동기화 스크립트(sync_state.py)를를 사용하여 관찰 내용에 대한 예측을 검증증했습니다.

토론 및 한계점

결과가 중요한 이정표를 달성했지만, ARC Prize 팀은 이 벤치마크를 포화화하는 것이 AGI의 증거가 되는 것은 아니라고 강조합니다. 환경이 결정론적이고 폐쇄적이기 때문에, 현실 세계의 개방성 있는 복잡성을 반영하지 못합니다.

Hacker News의 커뮤니티 토론에서는 몇 가지 중요한 관점을 제시했습니다:

"스네이크와 같은 퍼즐 게임을 최소한의 움직임으로 해결하는 것이 정말 지능의 정의인가요?"

"OpenAI가 이전에 ARC-AGI-3 테스트를 실행할 수 있었기에, 세트 내의 특정 테스트를 위한 맞춤형 harness를 구축할 수 있었던 것은 아닐까요?"

다른 관찰자들은 인간의 노동력과 비교했을 때 이러한 실행의 극심한한 비용(퍼즐당 약 $360)을 지적했습니다. 다만, 일부는 가격-성능 트렌드가 지속된다면 AI 비용이 결국 인간의 최저임금 아래로 떨어질 것이라고 주장했습니다.

또한, 외부 데이터에 따르면 Astra가 ARC-AGI-3에서는 탁월하지만, 매우 복잡한 수학적 문제에는 여전히 어려움을 겪고 있습니다. FrontierMath-Erdos 벤치마크에 대한 보고서에 따르면, GPT-6 Astra는 68개 문제 중 6개만을 해결했으며, 일부 솔루션은 $220,000 이상의 컴퓨팅 비용이 소요되었습니다.

Sources

관련