OpenAI o1-mini 릴리스 노트
OpenAI는 전체 o1 시리즈보다 낮은 비용과 더 높은 속도로 STEM 분야에서 높은 성능을 발휘하도록 설계된 특화된 추론 모델인 o1-mini를 출시했습니다. 이 모델은 광범위한 일반 세계 지식이 필요하지 않은 복잡한 추론이 요구되는 애플리케이션을 위해 설계되었습니다.
비용 및 가용성
o1-mini는 Tier 5 API 사용자에게 o1-preview보다 80% 저렴한 비용으로 제공됩니다. ChatGPT Plus, Team, Enterprise 및 Edu 사용자에게는 o1-mini가 o1-preview의 대안으로 작동하여 더 높은 요청 제한과 낮은 지연 시간을 제공합니다.
STEM 추론 성능
o1-mini는 사전 학습 단계에서 STEM 추론에 최적화된 소형 모델이며, 전체 o1 모델과 동일한 고성능 강화 학습(RL) 파이프라인을 사용해 훈련되었습니다. 높은 용량 모델이 갖는 광범위한 세계 지식은 부족하지만, 특정 기술 분야에서 비교 가능한 추론 성능을 달성합니다.
수학 및 코딩
기술 벤치마크에서 o1-mini는 전체 o1 모델과 경쟁력 있는 성능을 보여주며, 여러 분야에서 o1-preview보다 우수한 성과를 보입니다:
- 수학: 고등학교 AIME 수학 대회에서 o1-mini는 70.0%를 기록하여 미국 고등학생 상위 약 500명 수준에 해당합니다. 이는 o1-preview(44.6%)보다 우수하며 o1(74.4%)와 경쟁합니다.
- 코딩: Codeforces에서 o1-mini는 Elo 1650을 달성하여 경쟁 프로그래머 중 86번째 백분위에 해당합니다. 이는 o1-preview(1258)보다 높으며 o1(1673)와 경쟁합니다. 또한 이 모델은 HumanEval 벤치마크와 고등학교 수준 사이버보안 캡처 더 플래그(CTF) 챌린지에서도 좋은 성과를 보입니다.
일반 STEM 및 인간 선호도
o1-mini는 MATH-500 및 GPQA(과학)와 같은 추론이 필요한 학술 벤치마크에서 GPT-4o보다 우수합니다. 그러나 GPQA에서는 o1-preview에 뒤처지고, 비-STEM 사실 지식이 제한적이어서 MMLU에서는 GPT-4o보다 성능이 낮습니다.
인간 선호도 평가에 따르면, o1-mini는 추론 중심 분야에서 GPT-4o보다 선호되지만 언어 중심 작업에서는 선호되지 않습니다.
모델 속도 및 지연 시간
o1-mini는 더 큰 모델에 비해 훨씬 빠른 응답 시간을 제공합니다. 단어 추론 테스트에서 o1-mini는 o1-preview보다 약 3-5배 빠르게 정답에 도달했으며, GPT-4o는 질문에 올바르게 답하지 못했습니다.
안전성 및 견고성
o1-mini는 o1-preview와 동일한 정렬 및 안전 기술을 사용합니다. StrongREJECT 데이터셋을 활용한 내부 평가에서 o1-mini는 GPT-4o에 비해 탈옥 견고성이 59% 더 높게 나타났습니다.
| 지표 | GPT-4o | o1-mini |
|---|---|---|
| 해로운 프롬프트에 대한 안전한 완성 거부 비율 (표준) | 0.99 | 0.99 |
| 해로운 프롬프트에 대한 안전한 완성 비율 (도전적: 탈옥 및 엣지 케이스) | 0.714 | 0.932 |
| 양성 엣지 케이스에 대한 준수 비율 | 0.91 | 0.923 |
| Goodness@0.1 StrongREJECT 탈옥 평가 | 0.22 | 0.83 |
| 인간 제공 탈옥 평가 | 0.77 | 0.95 |
제한 사항
o1-mini는 STEM에 특화되어 있기 때문에 전기, 날짜, 일반 퀴즈와 같은 비-STEM 주제에 대한 사실 지식은 GPT-4o mini와 같은 소형 모델과 비슷합니다. OpenAI는 향후 버전에서 이러한 제한을 해결하고 다른 모달리티 및 전문 분야로의 확장을 모색할 계획입니다.
Sources
- OriginalOpenAI o1-mini