OpenAI가 GPT-6 Sol과 Luna 발표
TL;DR
OpenAI는 GPT-6 Astra의 비용 효율적인 후속 모델인 GPT-6 Sol과 GPT-6 Luna를 출시했습니다. 이 모델들은 GPT-5.6 대비 API 가격을 절반으로 줄이며, 전문 업무, 사실성, 코딩, 컴퓨터 사용 워크로드에서 높은 성능을 유지합니다.
GPT-6 패밀리 확장 개요
OpenAI는 플래그십 모델인 GPT-6 Astra를 보완하기 위해 GPT-6 Sol과 GPT-6 Luna를 도입했습니다. 세 모델은 동일한 학습 방법론을 공유하지만, Sol과 Luna는 낮은 지연 시간과 낮은 추론 비용을 최적화했습니다. 캐싱 및 추론 인프라의 개선으로 GPT-5.6 프로모션 가격 대비 50% 가격 인하가 가능해져, 일상적인 애플리케이션에서 고급 AI를 더 쉽게 접근할 수 있게 되었습니다.
API 가격 인하
| 모델 | 입력 가격 (1M 토큰당) | 출력 가격 (1M 토큰당) | 상대적 할인 |
|---|---|---|---|
| GPT-6 Sol | $4 → $2 | $20 → $10 | 50% 저렴 |
| GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% 저렴 |
가격은 100만 토큰당 기준입니다. GPT-6 Astra는 최상의 결과가 필요한 사용자를 위한 최상위 모델로 유지됩니다.
전문 업무 성능
주요 결과
GPT-6 Sol은 AutomationBench 벤치마크에서 Claude Opus 5를 능가하면서도, 작업당 비용은 Opus 5의 9%에 불과합니다. GPT-6 Luna는 이전 모델 대비 5.4%포인트 향상되며, 비용은 58% 낮습니다.
상세 비교
- AutomationBench 1.0.6는 47개 도구를 통한 엔드투엔드 워크플로우에서 AI 에이전트를 평가합니다. GPT-6 Sol (xhigh effort)은 **33.2%**의 점수를 기록하며, 작업당 비용은 $0.27로, GPT-6 Astra (low effort)와 Claude Opus 5 (max effort) 모두를 점수와 비용 면에서 모두 능가합니다.
- Agents' Last Exam에서 GPT-6 Sol (max effort)은 **56.4%**를 기록하여 Claude Opus 5를 넘어서면서도 작업당 비용은 60% 감소했습니다.
사실성 향상
OpenAI 내부 사실성 벤치마크에서 GPT-6 Sol은 GPT-5.6 Sol보다 약 절반의 사실 오류를 범하며, 비용의 일부만으로 Astra 수준의 신뢰성에 근접합니다. GPT-6 Luna도 상당한 성과를 보이며, 더 높은 노력 수준에서 실행할 경우 GPT-5.6 Sol의 사실성 수준을 유지하면서 비용은 약 1/100에 불과합니다.
코딩 능력과 비용 효율성
주요 결과
FrontierCode 및 DeepSWE v1.1 벤치마크에서 GPT-6 Sol은 최고 경쟁 모델과 비슷한 코딩 품질을 제공하면서도, 작업당 비용을 최대 80%까지 줄였습니다.
벤치마크 세부 정보
- FrontierCode: GPT-6 Sol은 GPT-5.6 Sol을 능가하며, Claude Fable 5.1 (xhigh effort)과 비슷한 성능을 낮은 비용으로 달성합니다.
- DeepSWE v1.1: GPT-6 Sol (max effort)은 **68.8%**를 기록하여 Claude Fable 5의 최고 점수와 1.1%포인트 차이로, 작업당 비용은 약 80% 낮습니다. GPT-6 Luna (max effort)는 **66.6%**를 기록하여 Claude Opus 5와 Claude Fable 5의 중간 노력 수준 성능과 유사하면서도 작업당 비용은 93%~96% 낮습니다.
컴퓨터 사용 성능
GPT-6 Sol (xhigh effort)은 OSWorld 2.0 오프라인에서 **60.5%**의 점수를 기록하여, Claude Opus 5 (medium effort)와 동일한 성능을 내면서도 비용은 약 80% 낮습니다. GPT-6 Luna (max effort)는 GPT-5.6 Sol (medium effort)을 능가하면서도 비용은 단지 1/10에 불과합니다.
향상된 협업 스타일
Sol과 Luna는 Astra의 정교한 커뮤니케이션 스타일을 이어받았습니다: 더 명확한 설명, 더 적은 전문 용어, 더 적은 관련 없는 세부 정보, 내용을 희생하지 않은 약간 더 짧은 답변입니다. 예시 비교를 통해 Sol이 GPT-5.6 전신보다 더 신중하고 정확한 응답을 제공함을 확인할 수 있습니다.
에이전트를 위한 프롬프트 캐싱 기술 발전
OpenAI는 더 높은 기본 캐시 히트율과 캐시된 입력 토큰 읽기 90% 할인을 도입했습니다. 새로운 개발자 도구로는 다음과 같은 항목이 포함됩니다:
- 캐시 사용량을 시각화할 수 있는 Prompt Caching Dashboard
- 캐싱 기회를 놓친 부분을 식별하는 진단 도구
- 캐시된 컨텍스트를 유지하는 이해 노력 및 도구 가용성 조절 기능
- 캐시된 프롬프트 접두사 정의를 위한 명시적 브레이크포인트 GitHub 보고서에 따르면, 이러한 변경으로 수십억 건의 요청에서 신선한 프롬프트 토큰 처리 비율이 50% 이상 감소하여 Copilot 응답 속도가 가속화되었습니다.
일치성 향상
Sol과 Luna는 Astra의 일치성 개선을 기반으로 합니다. 내부 평가 결과, GPT-5.6 모델 대비 코딩 작업에서 오해를 유도하는 주장의 비율이 낮습니다. 보고된 지표는 의도적으로 도전적인 시나리오를 대상으로 하며, 일반적인 사용 시 실패율을 반영하지 않습니다. 전체 결과는 GPT-6 Astra 시스템 카드에서 확인할 수 있습니다.
가용성
- ChatGPT Work 및 Codex: GPT-6 Sol과 GPT-6 Luna는 Plus, Pro, Business, Enterprise, Edu 티어에서 사용 가능합니다.
- 무료 및 Go 사용자: 데스크톱 앱을 통해 GPT-6 Luna에 접근할 수 있습니다.
- API: 모델은
gpt-6-sol과gpt-6-luna로 접근 가능합니다. - ChatGPT: 점진적으로 하루 동안 롤아웃될 예정이며, 모델이 아직 표시되지 않은 경우 재시도해야 할 수 있습니다.
모든 평가는 OpenAI의 연구 환경 또는 API를 통해 수행되었으며, 실제 ChatGPT는 시스템 프롬프트 및 도구 차이로 인해 다를 수 있습니다. 경쟁 모델 점수는 공개된 보고서에서 인용되었습니다.
Sources
- OriginalIntroducing GPT-6 Sol and Luna