OpenAI GPT‑6 Sol 및 Luna 출시: 50% 가격 인하 및 성능 개요

TL;DR

OpenAI는 GPT‑6 Sol과 GPT‑6 Luna을 출시했으며, 이들 모델은 GPT‑5.6의 전신 모델보다 각각 50 % 저렴하면서도 전문 업무 성능, 사실성 정확도, 코딩 능력, 컴퓨터 사용 효율성에서 측정 가능한 향상을 제공합니다.


가격 혁신

모델 입력 가격 (1 M 토큰당) 출력 가격 (1 M 토큰당) 상대적 감소율
GPT‑6 Sol $2 (이전 $4에서 하락) $10 (이전 $20에서 하락) 50 %
GPT‑6 Luna $0.10 (이전 $0.20에서 하락) $0.50 (이전 $1.20에서 하락) 50 %

OpenAI는 가격 인하가 API 사용자와 ChatGPT 구독 레벨에 직접 전달된다고 밝혔습니다. 저렴한 요금은 일상적인 자동화 및 대규모 응용 프로그램에 고급 AI를 실용적으로 활용할 수 있도록 하기 위한 것입니다.


전문 업무 성능

  • AutomationBench (47개 도구 워크플로우 벤치마크):
    • GPT‑6 Sol (초고수준 노력)은 Claude Opus 5 (최대 노력)를 능가하면서도 작업당 비용은 Opus 5의 **9 %**에 불과합니다.
    • GPT‑6 Luna (고수준 노력)은 이전 모델 대비 5.4 pp 향상되었으며 비용은 58 % 감소했습니다.
  • Agents’ Last Exam (복잡한 워크플로우 평가): GPT‑6 Sol (최대 노력)은 **56.4 %**의 점수를 기록하여 Claude Opus 5와 동일한 품질을 제공하지만 비용은 60 % 낮은 수준입니다.

이 결과는 Sol과 Luna가 기업 프로세스 자동화의 비용-지능 경계에서 우위를 점하고 있음을 보여줍니다.


사실성 향상

OpenAI의 내부 사실성 테스트(사용자가 오류를 표시한 실제 대화 기반)에 따르면:

  • GPT‑6 Sol은 GPT‑5.6 Sol보다 사실 오류가 약 절반 정도이며, Astra 수준의 신뢰성에 가까워졌습니다.
  • GPT‑6 Luna는 더 높은 추론 노력 수준에서 실행될 경우 GPT‑5.6 Sol과 동일한 사실성 수준을 달성하지만 비용은 **약 1 %**에 불과합니다.

평가에서는 테스트 세트가 오류 발생 가능성이 높은 질의에 치우려 있어 일반 사용 시 절대 오류율은 더 낮을 것이라고 언급했습니다.


코딩 벤치마크

  • FrontierCode (코드 변경 준비도): GPT‑6 Sol은 GPT‑5.6 Sol을 능가하며, Claude Fable 5.1 (초고수준 노력)과 동등한 성능을 낮은 가격에 제공합니다.
  • DeepSWE v1.1 (소프트웨어 공학 작업): GPT‑6 Sol (최대 노력)은 **68.8 %**의 점수를 기록하여 Claude Fable 5의 최고 점수와 1.1 pp 이내에 머물며, 작업당 비용은 약 80 % 저렴합니다.
  • GPT‑6 Luna (최대 노력)은 **66.6 %**의 점수를 기록하여 Claude Opus 5와 유사한 성능을 보이며, 작업당 비용은 93 % 저렴합니다.

커뮤니티의 의견은 혼재되어 있습니다: 일부 사용자는 Luna를 "무제한 파트너 프로그래머"로 평가하지만, 다른 사용자는 5.6 버전 대비 Luna의 코딩 점수가 하락했다고 보고했습니다.


컴퓨터 사용 효율성

  • OSWorld 2.0 오프라인 (장기적 컴퓨터 사용 워크플로우): GPT‑6 Sol (초고수준)은 Claude Opus 5 (중간 수준)과 동등한 성능을 보이며 비용은 약 80 % 감소했습니다. GPT‑6 Luna (최대)는 GPT‑5.6 Sol (중간)을 초과하며 비용은 10분의 1 수준입니다.

일치성 및 커뮤니케이션 스타일

OpenAI는 Sol과 Luna가 Astra의 일치성 개선을 이어받았다고 주장하며, 오해를 유도하는 코딩 주장의 빈도가 낮아졌다고 밝혔습니다. 질적 사례에서는 더 간결하고 전문 용어 없이, 이상한 어조의 오류가 적은 스타일이 강조되었습니다.


프롬프트 캐싱 향상

  • 새롭게 도입된 Prompt Caching Dashboard와 진단 도구를 통해 개발자는 캐시 히트율과 놓친 기회를 확인할 수 있습니다.
  • 추론 노력 또는 도구 가용성을 조정해도 캐시된 접두사가 유지되며, 캐시된 입력 토큰 읽기에서 최대 90 % 할인이 가능합니다.
  • GitHub는 수십억 건의 요청에서 50 % 이상의 신선한 토큰 처리 감소를 보고하며, Copilot 응답 속도가 가속화되었다고 밝혔습니다.

가용성

  • ChatGPT Work 및 Codex: Plus, Pro, Business, Enterprise, Edu 사용자에게 Sol과 Luna가 실시간으로 제공됩니다.
  • 무료/Go 사용자는 데스크톱 앱을 통해 Luna에 접근할 수 있습니다.
  • API 식별자: gpt-6-sol 및 gpt-6-luna.
  • ChatGPT 내 점진적 롤아웃 중이며, 모델은 하루 중 후반에 나타날 수 있습니다.

커뮤니티 반응 (선택된 HN 댓글)

  • 가격 영향 – 많은 댓글러들(예: @simonw, @Cu3PO42)은 Luna의 "무지개 같은" $0.10/​M-입력 가격이 게임 체인저라고 강조합니다.
  • 모델 선택 – Sol, Luna, Astra 중 어떤 것을 선호할지 사용자들 사이에서 논의되고 있으며, 일부는 더 높은 추론 수준이 낮은 기본 모델 크기를 보완할 수 있다고 지적합니다.
  • 성능 변동성 – 여러 사용자가 Luna의 코딩 점수가 5.6 버전보다 약간 하락했다고 보고했으며, Sol은 초고수준 노력에서 강력한 성과를 보이지만 더 많은 추론 단계로 인해 느릴 수 있다고 언급했습니다.
  • 캐시 도구 – @apitman 같은 개발자들은 고장난 프록시를 수정한 후 새 캐시 대시보드를 칭찬했습니다.
  • 경쟁 환경 – 댓글러들은 OpenAI의 가격 전쟁을 Anthropic의 Opus 5.5와 비교하며, OpenAI의 투명한 벤치마크 표를 강조했습니다.

결론

OpenAI의 GPT‑6 Sol과 Luna는 Astra의 지능을 대부분 유지하면서 가격을 절반으로 낮춘 모델로 GPT‑6 시리즈를 확장했습니다. 벤치마크는 자동화, 사실성, 코딩, 컴퓨터 사용 작업에서 뛰어난 비용 효율성을 입증했으며, 새로운 캐시 도구는 운영 비용을 추가로 낮추고 있습니다. 이 출시는 고용량 개발자 워크플로우에 특히 유리한 환경에서 Anthropic 및 기타 선도 모델들과의 경쟁에서 OpenAI의 입지를 강화합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch