OpenAI GPT-5.6 출시: 프론티어 인텔리전스와 효율성의 융합
OpenAI는 다양한 작업에서 높은 성능과 비용 효율성을 균형 있게 유지하도록 설계된 GPT-5.6 모델 제품군을 출시했습니다. flagship model인 GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 Claude Fable 5보다 성능이 우수하면서도 비용은 절반 미만입니다. 또한 이 제품군에는 가격의 절반으로 GPT-5.5의 인텔리전스 벤치마크와 맞먹는 Terra, 그리고 Sol보다 80% 저렴한 가장 빠르고 저렴한 옵션인 Luna가 포함됩니다.
토큰당 인텔리전스 효율성
GPT-5.6은 학습 중에 작업 성공과 효율성을 모두 최적화함으로써 현재까지最高의 토큰당 인텔리전스 효율성을 달성합니다. 이 접근 방식은 모델이 작업 완성을 위한 더 직접적인 경로를 취하도록 형성하여, 토큰당 더 많은 작업을 효과적으로 수행하게 합니다.
추론 스택 최적화
OpenAI는 latency, 신뢰성, 인텔리전스를 손상시키지 않고 동일한 하드웨어로 더 많은 토큰을 제공하도록 추론 스택을 최적화했습니다. 이러한 개선점은 Codex 내에서 GPT-5.6 Sol을 사용하여 시스템을 자율적으로 최적화함으로써 주로 이끌어졌습니다.
로드 밸런싱 및 라우팅
Codex 내의 GPT-5.6 Sol은 프로덕션 트래픽을 분석하고 요청 라우팅을 위한 휴리스틱을 조정하는 데 사용되었습니다. 여기에는 지리 및 용량에 따라 요청이 전 세계적으로 어떻게 분배되는지 최적화하고, 클러스터 및 인스턴스 내에서의 가속기와 컴퓨팅 코어 전반에 걸쳐 요청이 어떻게 분할되는지 최적화하는 것이 포함됩니다.
커널 최적화 및 GPU 성능
메모리 이동과 비효율적인 데이터 레이아웃으로 인한 GPU 유휴 시간을 줄이기 위해, GPT-5.6 Sol은 생산 커널을 자율적으로 다시 작성하고 최적화했습니다. 오픈소스 GPU 프로그래밍 언어인 Triton과 Gluon을 사용하여 이러한 커널 개선으로 엔드투엔드 서빙 비용이 20% 감소했습니다. OpenAI는 오픈소스 Floating-Point Sanitizer(FpSan)를 활용하여 이러한 AI 생성 커널의 정확성을 검증했습니다.
추측 디코딩
추측 디코딩의 개선을 통해 토큰 생성 효율성이 15% 이상 증가했습니다. GPT-5.6 Sol은 자체 초안(스펙큘레이터) 모델을 위해 수백 개의 아키텍처 실험을 설계하고 테스트했으며, 훈련 과정을 자율적으로 관리하고 하드웨어 오류나 불안정 시 개입했습니다.
워크로드별 구성
Codex 내의 GPT-5.6 Sol을 사용하여 OpenAI는 광범위한 휴리스틱에서 추론 엔진을 위한 초최적화 구성으로 전환했습니다. 프로덕션 워크로드를 분석하여 시스템은 특정 프롬프트 및 출력 길이와 쿼리 특성에 따라 배치, 샤딩, KV 캐시 관리를 최적화합니다.
에이전틱 하네스와 오케스트레이션
ChatGPT Work과 Codex는 여러 모델 요청과 툴 호출을 포함하는 복잡한 작업을 관리하기 위해 Rust 기반 오케스트레이션 레이어인 에이전틱 하네스를 활용합니다. 하네스는 반복 작업을 줄여 전반적인 성능을 향상시키는 데 중점을 둡니다.
컨텍스트 블로트 감소
하네스는 통합, 사용자 정의 MCP 도구, 플러그인이 필요한 경우에만 나타나도록 지연 검색을 활용합니다. 예기치 않은 컨텍스트 윈도우 소비를 방지하기 위해, 모델이 명시적으로 다른 제한을 요청하지 않는 한 기본적으로 툴 출력은 10,000 토큰으로 제한됩니다.
프롬프트 캐싱 및 접두사 보존
프롬프트 캐시 히트율을 극대화하기 위해, 하네스는 모델이 볼 수 있는 모든 기록을 추가 전용으로 취급하여 새로운 메시지와 툴 결과를 컨텍스트 끝에 삽입하지 않고 추가합니다. 또한, 툴은 결정적 순서로 제시되며, 런타임 설정은 툴 정의에 내장되는 것이 아니라 실행 중에 적용되어 프롬프트 접두사가 정확하고 재사용 가능하도록 보장합니다.