OpenAI GPT-5.6 Sol ARC-AGI-3 벤치마크 성능 최적화
OpenAI는 retained reasoning과 compaction이라는 두 가지 특정 API 설정을 활성화함으로써 GPT-5.6 Sol의 ARC-AGI-3 벤치마크 성능이 13.3%에서 38.3%로 향상되었음을 입증했습니다. 이 발견은 벤치마크 점수가 모델 자체의 고유한 능력보다는 평가 하네스(harness)의 구성에 따라 결정되는 경우가 많다는 점을 시사합니다.
ARC-AGI-3에서의 성능 향상
GPT-5.6 Sol은 retained reasoning과 compaction이 활성화된 Responses API 기반의 하네스를 사용했을 때 ARC-AGI-3 공개 세트에서 38.3%의 점수를 달성했습니다. 반면, 공식 ARC-AGI-3 하네스에서는 13.3%의 점수를 기록했습니다.
이 점수들은 모델 성능을 인간 기준점과 비교하는 Relative Human Action Efficiency (RHAE)를 사용하여 측정되었습니다. 참고로, OpenAI는 평균적인 인간 테스터가 동일한 작업에서 48%의 점수를 기록한 것으로 추정합니다. 이번 향상은 성능이 거의 3배 증가하는 동시에 출력 토큰 수를 6배 감소시킨 결과를 나타냅니다.
하네스 설계가 모델 추론에 미치는 영향
공식 ARC-AGI-3 하네스는 모델의 단점을 더 명확하게 드러내고 공정한 비교를 보장하기 위해 일반적인 설계를 사용합니다. 그러나 OpenAI는 이 하네스에서 GPT-5.6 Sol이 2D 퍼즐 게임 내에서 학습하고 추론하는 능력을 저해하는 두 가지 주요 한계를 식별했습니다:
Discarded Reasoning
공식 하네스에서는 각 게임 액션 이후 모든 프라이빗 추론(private reasoning)이 폐기되었습니다. 이로 인해 모델은 이전 이동으로 이어졌던 계획, 통찰 또는 생각을 참조할 수 없게 되어, 매 턴마다 게임 상태를 처음부터 다시 해석해야만 했습니다.
Rolling Truncation
컨텍스트 제한을 관리하기 위해 공식 하네스는 rolling truncation을 채택하여 대화가 175,000자를 초과하면 가장 오래된 메시지를 폐기합니다. 이는 모델이 초기 관찰 및 행동에 대한 기억을 잃게 만들며, 컨텍스트 윈도우를 지속적으로 가득 채워 성능을 저하시킬 수 있습니다.
기술적 솔루션: Retained Reasoning 및 Compaction
평가를 ChatGPT 및 Codex에서 모델이 배포되는 방식과 일치시키기 위해, OpenAI는 Responses API를 사용하는 하네스를 구현했습니다. 이 접근 방식은 두 가지 핵심적인 기술적 개선 사항을 도입했습니다:
Retained Reasoning
Responses API를 통해 이전 응답 ID를 전달함으로써, GPT-5.6 Sol은 도구 호출(tool calls)과 턴 전반에 걸쳐 프라이빗 추론을 자동으로 유지합니다. 이를 통해 모델은 시간에 따라 일관된 전략을 사용할 수 있으며, 매 턴 게임을 처음부터 다시 분석할 필요가 없으므로 각 액션 전 사고에 소요되는 시간을 줄일 수 있습니다.
Compaction
rolling truncation 대신 compaction을 사용하면 모델이 더 긴 실행 과정 동안 학습된 정보를 더 잘 보존할 수 있습니다. 단순히 오래된 데이터를 삭제하는 rolling truncation과 달리, compaction은 컨텍스트를 더 효율적으로 관리하여 모델이 더 적은 출력 토큰으로도 더 높은 점수를 유지할 수 있게 합니다.
API 개발자를 위한 권장 사항
OpenAI는 모델 성능을 극대화하려는 개발자들에게 실제 운영 환경에서 사용되는 설정을 채택할 것을 권장합니다. 구체적인 권장 사항은 다음과 같습니다:
- 기존의 Chat Completions API 대신 Responses API를 사용하십시오.
- 모델이 상호작용 전반에 걸쳐 논리적 흐름을 유지할 수 있도록 **reasoning을 유지(retain reasoning)**하십시오.
- 초기 턴의 중요한 정보를 잃지 않고 컨텍스트 윈도우를 관리하기 위해 compaction을 사용하십시오.