OpenAI o3 및 o4-mini 릴리스 노트 / 새로운 소식
OpenAI는 o3와 o4-mini를 출시했으며, 이는 확장된 추론을 위해 설계된 o-시리즈의 최신 모델입니다. 이 모델들은 최첨단 추론과 웹 검색, Python 데이터 분석, 이미지 생성 등 도구를 에이전트형으로 사용하고 결합하는 능력을 통합함으로써 일반적으로 1분 이내에 다면적인 문제를 해결하는 데 있어 지능과 유용성에서 큰 진전을 나타냅니다.
OpenAI o3와 함께하는 최첨단 추론
OpenAI o3는 현재까지 출시된 가장 강력한 추론 모델로, Codeforces, MMMU, SWE-bench 등 벤치마크에서 새로운 최첨단(SOTA) 성능을 달성했습니다(맞춤형 모델 전용 스캐폴드 없이 477개의 검증된 작업 고정 하위 집합을 평가함).
주요 성능 향상 사항은 다음과 같습니다:
- 오류 감소: 외부 전문가 평가에서 o3는 어려운 실제 작업에서 OpenAI o1보다 주요 오류를 20% 적게 발생시켰으며, 특히 창의적 아이디어 발상, 비즈니스/컨설팅, 프로그래밍 분야에서 두드러집니다.
- 분석적 엄밀성: 초기 테스트 사용자들은 o3가 엔지니어링, 수학, 생물학 분야에서 새로운 가설을 생성하고 비판적으로 평가하는 능력을 보여주었다고 언급했습니다.
- 시각 인식: o3는 그래픽, 차트, 이미지 분석에서 강력한 성능을 발휘합니다.
OpenAI o4-mini와 비용 효율적인 추론
OpenAI o4-mini는 대량·고처리 추론 작업을 위해 설계된 작고 최적화된 모델이며, 데이터 과학 및 비STEM 분야에서 이전 모델인 o3-mini보다 뛰어난 성능을 보입니다.
주목할 만한 벤치마크는 다음과 같습니다:
- AIME 성능: o4-mini는 AIME 2024 및 2025에서 가장 높은 성능을 보인 모델입니다. Python 인터프리터를 제공받으면 AIME 2025에서 99.5% pass@1(100% consensus@8)을 달성합니다.
- 효율성: 크기가 작아 o4-mini는 o3보다 훨씬 높은 사용 한도를 지원하면서도 코딩, 수학, 시각 작업에서 강력한 성능을 유지합니다.
멀티모달 추론 및 시각 통합
처음으로 o-시리즈 모델은 이미지를 사고 흐름에 직접 통합하여 단순히 이미지를 인식하는 것이 아니라 "이미지와 함께 생각"하도록 합니다. 이를 통해 모델은 시각적 및 텍스트적 추론을 결합해 복잡한 문제를 해결할 수 있습니다.
가능한 기능은 다음과 같습니다:
- 견고한 해석: 모델은 손으로 그린 스케치, 교과서 도표, 화이트보드 사진 등 흐릿하거나 저품질, 혹은 뒤집힌 이미지도 해석할 수 있습니다.
- 능동적 조작: 도구 사용을 통해 모델은 추론 과정에서 이미지를 확대, 회전, 변형하여 입력을 보다 잘 분석할 수 있습니다.
에이전트형 도구 사용 및 워크플로 자동화
OpenAI o3와 o4-mini는 강화 학습을 통해 언제, 어떻게 도구를 사용해 원하는 결과를 달성할지 추론하도록 훈련되었습니다. 이들은 API 함수 호출을 통해 ChatGPT 도구와 맞춤형 도구에 완전하게 접근할 수 있습니다.
이 전략적 접근 방식은 다음과 같은 다단계 워크플로를 가능하게 합니다:
- 반복적 연구: 웹을 여러 번 검색하고 결과를 분석하며, 발견된 정보를 기반으로 검색 쿼리를 전환합니다.
- 복합 합성: 공개 데이터를 위한 웹 검색, 예측을 위한 Python, 시각화를 위한 이미지 생성을 연계해 단일 복합 질의에 답합니다.
강화 학습(RL) 규모 확대
OpenAI는 대규모 RL이 GPT 시리즈 사전 학습과 유사하게 '컴퓨팅량 증가 = 성능 향상' 추세를 보인다고 관찰했습니다. 학습 컴퓨팅과 추론 시 컴퓨팅을 10배 늘림으로써 모델이 더 오래 '생각'하도록 허용하면 성능이 계속 상승한다는 것을 검증했습니다.
OpenAI o1과 동일한 지연 시간 및 비용에서 o3는 더 높은 성능을 제공하며, 추론 시간을 늘리면 추가적인 향상이 가능합니다.
안전 및 위험 완화
OpenAI는 이러한 모델을 위해 안전 교육 데이터를 재구성했으며, 탈옥, 악성코드 생성, 생물학적 위협(바이오리스크)에 대한 새로운 거부 프롬프트를 도입했습니다.
안전 조치에는 다음이 포함됩니다:
- 추론 LLM 모니터: 인간이 작성한 안전 사양으로 훈련된 모니터로, 바이오리스크 인간 레드팀 캠페인에서 약 99%의 대화를 표시했습니다.
- 준비 프레임워크: 두 모델 모두 사이버 보안, AI 자체 개선, 생물·화학 위험을 평가했으며, o3와 o4-mini는 세 카테고리 모두에서 '높음' 임계값 이하를 유지합니다.
Codex CLI 및 개발자 접근
OpenAI는 터미널에서 실행되는 오픈소스 경량 코딩 에이전트 Codex CLI를 도입했습니다. 이를 통해 사용자는 스크린샷이나 스케치를 o3와 o4-mini에 전달하면서 모델이 로컬 코드를 접근하도록 할 수 있습니다.
접근 세부 정보:
- ChatGPT: Plus, Pro, Team 사용자는 o3, o4-mini, o4-mini-high에 접근할 수 있습니다. Enterprise와 Edu 사용자는 일주일 후에 접근이 가능하며, 무료 사용자는 'Think' 옵션을 통해 o4-mini에 접근할 수 있습니다.
- API: 두 모델은 Chat Completions 및 Responses API를 통해 제공됩니다. Responses API는 추론 요약 및 함수 호출 주변의 추론 토큰 보존을 지원합니다.
- o3-pro: 더 긴 사고와 높은 신뢰성을 위해 설계된 o3 버전이 Pro 사용자를 위해 ChatGPT와 API에서 제공됩니다(2025년 6월 10일 기준).