OpenAI o3-mini 릴리스 노트 / 새로운 기능
OpenAI o3-mini는 STEM(과학, 수학, 코딩)에 최적화된 비용 효율적인 추론 모델로, 더 큰 OpenAI o1 모델과 비슷한 성능을 제공하면서 o1-mini의 낮은 비용과 감소된 지연 시간을 유지합니다. 현재 ChatGPT와 선택된 개발자를 위한 API에서 이용할 수 있습니다.
STEM 추론 및 성능
OpenAI o3-mini는 높은 정밀도와 속도가 필요한 기술 도메인을 위해 특별히 설계되었습니다. "중간" 추론 노력으로 수학, 코딩, 과학에서 OpenAI o1의 성능과 일치합니다.
기술 벤치마크
- 수학: AIME 2024 평가에서 o3-mini는 중간 노력으로 o1과 일치하며, 높은 추론 노력은 o1과 o1-mini 모두를 초과할 수 있게 합니다.
- 박사 수준 과학: GPQA Diamond 벤치마크(생물학, 화학, 물리학)에서 o3-mini는 낮은 노력으로 이미 o1-mini를 초과하며, 높은 노력으로 o1과 동등한 성능에 도달합니다.
- 연구 수준 수학: FrontierMath에서 o3-mini는 높은 추론 노력과 Python 도구를 사용하여 첫 시도에서 문제의 32% 이상을 해결하며, 이는 어려운 T3 문제의 28% 이상을 포함합니다.
- 경쟁 코딩: Codeforces에서 o3-mini는 모든 추론 노력 수준에서 o1-mini를 초과하며, 중간 노력에서는 o1의 성능과 일치합니다.
- 소프트웨어 엔지니어링: o3-mini는 SWE-bench Verified(n=477)에서 OpenAI가 출시한 모델 중最高 성능을 보입니다. 내부 도구 프레임워크를 사용하여 61%의 성공률을 달성합니다.
- LiveBench 코딩: o3-mini는 중간 추론 노력에서도 o1-high를 초과합니다.
인간 선호도 및 정확도
외부 전문가 테스터들은 o3-mini의 응답을 o1-mini보다 56%의 시간 동안 선호했으며, 어려운 실제 세계 질문에서 주요 오류가 39% 감소했다고 보고했습니다.
모델 속도 및 효율성
OpenAI o3-mini는 전신인 o1-mini에 비해 지연 시간이 크게 개선되었습니다. A/B 테스트에서 o3-mini는 o1-mini보다 24% 빠르게 응답을 제공했으며, 평균 응답 시간은 7.7초로 o1-mini의 10.16초보다 빠릅니다. 또한, o3-mini의 첫 토큰까지의 평균 시간은 o1-mini보다 2,500ms 더 빠릅니다.
개발자 기능 및 API 통합
OpenAI o3-mini는 다음과 같은 프로덕션 준비가 된 개발자 기능을 처음으로 지원하는 작은 추론 모델입니다:
- 함수 호출: 외부 도구와의 통합을 지원합니다.
- 구조화된 출력: 모델이 특정 JSON 스키마를 준수하도록 보장합니다.
- 개발자 메시지: 시스템 수준 지침을 위한 프롬프트 기능을 향상시킵니다.
- 추론 노력: 개발자는 특정 사용 사례에 속도와 지능의 균형을 맞추기 위해 낮음, 중간, 높음 중 추론 노력 수준을 선택할 수 있습니다.
- 스트리밍: o1-mini 및 o1-preview와 일관되게 스트리밍 응답을 지원합니다.
참고: o3-mini는 시각 기능을 지원하지 않으므로 시각적 추론 작업은 계속 OpenAI o1이 처리해야 합니다.
가용성 및 접근
- ChatGPT Plus, Team, 및 Pro: 즉시 이용 가능합니다. Pro 사용자는
o3-mini와o3-mini-high모두에 무제한으로 접근할 수 있습니다. - 무료 사용자: 처음으로, ChatGPT의 메시지 작성기의 'Reason' 옵션을 통해 추론 모델이 무료 사용자에게 제공됩니다.
- 엔터프라이즈: 접근은 2월에 예약되어 있습니다.
- API: 사용 등급 3-5의 개발자에게 Chat Completions, Assistants, 및 Batch API를 통해 점진적으로 제공됩니다.
- Rate Limits: Plus 및 Team 사용자의 rate limit은 o1-mini 기준 하루 50 메시지에서 o3-mini 기준 하루 150 메시지로 세 배 증가했습니다.
안전 및 정렬
OpenAI는 o3-mini를 훈련시키기 위해 "의사결정 정렬"을 활용했습니다. 이 과정은 모델이 응답을 생성하기 전에 인간 작성된 안전 사양에 대해 추론하도록 합니다. 이 접근 방식은 o3-mini가 어려운 안전 및 jailbreak 평가에서 GPT-4o를 znacz하게 초과할 수 있게 합니다. 모델은 OpenAI o1에 사용된 준비성 접근 방식과 일치하는 외부 레드 팀 및 안전 평가를 거쳤습니다.
Sources
- OriginalOpenAI o3-mini