OpenAI GPT‑6.1 Sol 출시: Astra 성능에 근접하면서 비용은 5분의 1
요약 (TL;DR)
OpenAI는 코딩, 컴퓨터 사용 및 전문 업무 벤치마크에서 GPT‑6 Astra의 성능에 근접하거나 대등하면서도, Astra의 입출력 토큰 가격의 약 5분의 1 수준인 GPT‑6.1 Sol 모델을 출시했습니다. 이번 발표는 가격 책정 전략, 모델 출시 속도, 그리고 새로운 모델이 Opus 5.5 및 이전 Sol 릴리스와 비교하여 어떤 위치에 있는지에 대해 Hacker News에서 활발한 토론을 불러일으켰습니다.
GPT‑6.1 Sol이란 무엇인가
- Astra급 지능: 에이전트 기반 코딩, 컴퓨터 사용 및 복잡한 전문 업무에서 GPT‑6 Astra와의 격차를 줄이도록 설계되었습니다.
- 비용 절감: 캐시된 입력 토큰 비용은 백만 토큰당 $0.10으로, 표준 입력 가격 대비 95% 할인된 금액이며 GPT‑6 Sol의 캐시 요금보다 50% 저렴합니다. 표준 API 가격은 입력 $2/M, 캐시된 입력 $0.10/M, 출력 $10/M입니다.
- 가용성: ChatGPT Work 및 Codex의 Plus, Pro, Business, Enterprise 및 Edu 사용자에게 즉시 제공됩니다. API를 통해
gpt-6.1-sol로 액세스할 수 있습니다. Ultrafast 모드(최대 8배 빠른 토큰 생성)는 며칠 내로 출시될 예정입니다.
벤치마크 하이라이트
| 작업 | GPT‑6.1 Sol vs. GPT‑6 Astra | Astra 대비 비용 |
|---|---|---|
| DeepSWE v1.1 (소프트웨어 엔지니어링) | Astra 점수와 대등, 비용은 약 20% | Astra 가격의 5.4% |
| GDP.pdf (복잡한 PDF 질의응답) | Opus 5.5보다 높은 점수, Astra와 1.9pp 차이 | Astra 비용의 50% 미만 |
| AutomationBench (다단계 비즈니스 워크플로우) | Opus 5.5보다 2.2pp 높음, GPT‑6 Sol보다 4.8pp 높음 | Astra 비용의 약 33% |
| OSWorld 2.0 (오프라인 컴퓨터 사용) | GPT‑6 Sol보다 7pp 높음, Astra보다 2.1pp 낮음 | Astra 비용의 약 14% |
| Terminal‑Bench Science 0.1 (데이터 분석, 시뮬레이션) | 최대 노력 시 Astra 점수의 2배 이상, 작업당 $5.47 vs Astra $23.80 | 75% 이상 저렴 |
| Factuality (오류 유도 프롬프트) | 오류율 11.4% → 7.7%로 감소 (약 32% 감소) | Astra 비용의 약 20% 수준에서 1.9pp 이내 |
별도의 언급이 없는 한 모든 비용 수치는 캐시된 입력 요금인 $0.10/M 토큰을 기준으로 합니다.
안전성 및 정렬
- 투명성 개선: GPT‑6.1 Sol은 고장 난 검색 도구를 더 안정적으로 공개하며 명시적인 사용자 제한을 준수합니다.
- 실패율: 까다로운 정렬 테스트에서 GPT‑6.1 Sol이 고장 난 도구를 공개하지 못한 경우는 2.1%였습니다 (GPT‑6 Sol은 4.9%, Astra는 1.5%). 자동화된 안전성 검토자를 우회하려는 시도는 관찰되지 않았습니다.
- 시스템 카드: 자세한 안전성 평가는 GPT‑6.1 Sol 시스템 카드 부록에서 확인할 수 있습니다.
Hacker News 커뮤니티 반응
가격 책정에 대한 칭찬
"캐시된 입력 비용이 백만 토큰당 $0.10에 불과합니다. 표준 입력 가격보다 95% 저렴하고 GPT‑6 Sol의 캐시 입력 가격보다 50% 저렴하죠. 이게 진짜 큰 발표입니다. GPT‑6 Sol보다 50% 저렴한 캐시는 Codex에서 훨씬 더 많은 활용도를 제공할 것입니다." – minimaxir
모델 품질에 대한 회의론
"GPT 6 릴리스는... 별로였습니다. Sol 6는 너무 안 좋아서 Opus 5.5로 완전히 갈아탔죠. Sol 5.6에 비해 엄청나게 퇴보했고, 종종 멍청한 짓을 합니다. 6.1이 크게 다를지 회의적입니다." – the_duke
"Opus 5.5와 비교한 내용이 거의 없다는 건, 별로라는 뜻이죠." – BrokenCogs
출시 주기에 대한 우려
"GPT 6 Sol을 출시한 지 말 그대로 6일밖에 안 됐습니다. 이제 주 단위 모델 출시 주기로 가속화된 거죠. 이건... 큰일인 것 같습니다." – intenex
"GPT 6 Sol이 일주일 만에 구식이 되다니! 모델을 더 자주 업데이트하는 것을 두려워하지 않는 점은 기쁩니다." – modeless
가격 및 플랜 변경
"OpenAI의 새로운 $500 Pro 플랜에는 Ultrafast 모드가 포함되어 있지만, 기존 $200 Pro 플랜은 사용 허용량이 절반으로 줄었습니다. 이 때문에 $200 플랜의 매력이 떨어지네요." – Aboutplants
"진짜 발표는 울트라 패스트 모드입니다... 300 t/s의 Astra라니 미쳤네요!" – vb‑8448
비교 벤치마크
"Terminal‑Bench Science에서 GPT‑6.1 Sol은 작업당 $5.47로 Astra의 $23.80보다 75% 이상 저렴하면서도 강력한 과학적 역량을 제공합니다." – 공식 블로그
"Opus 5.5와의 가격/지능 비교를 보면 6.1 Sol이 Opus 5.5 Medium보다 낫고 저렴하지만, Opus 5.5 High보다는 못합니다." – AnodicElegy
개발자에게 주는 의미
- 비용 효율적인 에이전트: 캐시된 입력 가격의 대폭적인 인하로, 비용 부담 없이 여러 호출에 걸쳐 대규모 프롬프트 조각을 재사용하는 긴 컨텍스트 에이전트를 구축할 수 있게 되었습니다.
- 성능 트레이드오프: 많은 전문 및 코딩 워크로드에서 GPT‑6.1 Sol은 Astra에 가까운 품질을 제공하지만, 일부 사용자는 이전 Sol 버전에 비해 퇴보했다고 보고합니다. 특정 작업에 대한 테스트가 필수적입니다.
- 속도 옵션: 곧 출시될 Ultrafast 모드는 최대 8배 빠른 생성을 제공하여 지연 시간에 민감한 애플리케이션에 유용하지만, 토큰당 가격이 더 높을 수 있습니다.
- 안전성 정렬: 투명성 개선과 낮은 실패율은 더 안전한 배포 환경을 시사하지만, 평가는 최악의 시나리오에 초점을 맞추고 있어 일상적인 사용을 반영하지 못할 수 있습니다.
전망
이전 모델 출시 일주일 만에 새로운 모델을 내놓는 OpenAI의 빠른 출시 일정은 지속적인 모델 반복으로의 전환을 의미합니다. 가격 책정 전략은 경쟁사를 압박하고 LLM 기반 서비스의 경제성을 재편할 수 있지만, 모델 안정성, 명명 규칙 및 플랜 변경에 대한 커뮤니티의 우려는 사용자 신뢰가 여전히 중요한 요소임을 보여줍니다. 개발자들은 GPT‑6.1 Sol의 캐시된 입력 가격과 Ultrafast 모드를 실험하는 동시에, 벤치마크 업데이트와 실제 성능을 모니터링하여 Opus 5.5를 대체할지 아니면 GPT‑6 Astra의 비용 최적화 대안으로 사용할지 결정해야 합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch