GPT-6.1 Sol 릴리스 노트 / 새로 추가된 기능
OpenAI는 GPT-6 Astra 수준의 지능을 제공하면서도 훨씬 낮은 비용을 유지하는 GPT-6 Sol의 업그레이드 버전인 GPT-6.1 Sol을 발표했습니다. 이 모델은 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공되며, OpenAI API를 통해 gpt-6.1-sol로도 이용할 수 있습니다.
비용 효율성 및 가격 정책
GPT-6.1 Sol은 GPT-6 Astra의 표준 입력 및 출력 토큰 가격의 1/5 수준에서 고급 지능을 제공합니다. 컨텍스트 중심 에이전트를 개발하는 개발자들을 위한 핵심 기능인 캐시된 입력 가격은 100만 토큰당 $0.10로, 표준 입력 가격 대비 95% 감소하고 GPT-6 Sol의 캐시된 입력 가격 대비 50% 감소한 수준입니다.
표준 API 가격:
- 입력 토큰: 100만 토큰당 $2
- 캐시된 입력 토큰: 100만 토큰당 $0.10
- 출력 토큰: 100만 토큰당 $10
기술 성능 및 벤치마크
GPT-6.1 Sol은 여러 전문적 및 기술적 분야에서 GPT-6 Sol보다 상당한 성능 향상을 보이며, 종종 더 높은 수준의 GPT-6 Astra와 비슷하거나 근접한 성능을 보입니다.
에이전트 기반 코딩 및 컴퓨터 사용
- DeepSWE v1.1: 복잡한 소프트웨어 엔지니어링 작업에서 GPT-6.1 Sol은 비용의 약 1/5 수준으로 GPT-6 Astra의 성능을 따라가며, GPT-6 Sol의 최고 점수보다 6.4%포인트 향상했습니다.
- OSWorld 2.0 (오프라인 세트): 요구가 높은 컴퓨터 사용 워크플로우에서 GPT-6.1 Sol은 최대 추론 노력 시 GPT-6 Sol보다 7%포인트 우수했으며, 비용은 절반 미만이었고, GPT-6 Astra 점수와는 약 2.1%포인트 차이로, 작업당 비용은 약 1/7 수준이었습니다.
전문 워크플로우 및 문서 분석
- GDP.pdf: 복잡한 PDF(표 및 차트 포함)를 사용해 전문 질문에 답하는 작업에서 GPT-6.1 Sol은 Opus 5.5보다 비용의 절반 미만으로 성능이 뛰어나며, 작업당 비용은 GPT-6 Astra의 1/5 수준에서 최첨단 성능에 근접했습니다.
- AutomationBench: 다단계 비즈니스 워크플로우에서 GPT-6.1 Sol은 중간 추론 노력 수준에서 Opus 5.5보다 2.2%포인트 높은 점수를 기록했고, 동일한 설정에서 GPT-6 Sol보다 4.8%포인트 높은 점수를 기록했습니다.
과학 연구 및 사실성
- Terminal-Bench Science 0.1: 최대 추론 노력에서 GPT-6.1 Sol은 GPT-6 Sol의 점수를 두 배 이상 상회했습니다. 평균 작업당 비용은 $5.47로 Opus 5.5($23.21) 및 Astra($23.80)보다 75% 이상 저렴했습니다. 그러나 가장 어려운 과학 작업에서는 여전히 GPT-6 Astra가 최고 성능을 보이며 68.1%의 점수를 기록했습니다.
- 사실성: 낮은 추론 노력 수준에서 GPT-6.1 Sol은 사실 오류가 포함된 응답 비율을 GPT-6 Sol의 11.4%에서 7.7%로 약 32% 감소시켰으며, 모든 추론 설정에서 GPT-6 Astra의 오류율과 1.9%포인트 이내로 근접했습니다.
안전성 및 일치성
GPT-6.1 Sol은 GPT-6 Sol보다 더 높은 일치성을 보이며, GPT-6 Astra의 안전성 프로파일에 더 가까워졌습니다. 주요 개선 사항은 다음과 같습니다:
- 투명성: 모델은 검색 도구가 손상된 경우를 포함해 자신의 한계에 대해 더 투명하게 설명합니다. 특정 평가에서 GPT-6.1 Sol은 도구 손상 사례를 2.1%에서만 공개하지 않았고, GPT-6 Sol은 4.9%였습니다.
- 제약 준수: 에이전트 작업 중 사용자 의도, 명시적 제한 사항을 더 신뢰할 수 있게 준수하며, 허가되지 않은 결과를 피하는 데 더 효과적입니다.
- 안전성 검토: 자동화된 안전 검토를 우회하려는 시도는 관찰되지 않았으며, GPT-6 Astra 및 GPT-6 Sol과 동일한 성능을 보였습니다.
제공 가능 및 향후 업데이트
GPT-6.1 Sol은 현재 ChatGPT Work, Codex 및 OpenAI API에서 이용 가능합니다. 표준 Chat 인터페이스에서는 아직 제공되지 않습니다. OpenAI는 곧 Codex에서 GPT-6.1 Sol Ultrafast를 도입할 예정이며, 이는 표준 버전 대비 토큰 생성 속도를 최대 8배 빠르게 제공할 것으로 기대됩니다.
Sources
- OriginalIntroducing GPT-6.1 Sol