OpenAI gpt-oss 릴리즈 노트
OpenAI는 gpt-oss-120b와 gpt-oss-20b를 출시했으며, 이는 고성능 추론 및 효율적인 배포를 위해 설계된 최첨단 오픈-웨이트 언어 모델 두 개입니다. Apache 2.0 라이선스를 갖고 있으며, 이 모델들은 소비자 하드웨어에 최적화되어 있고, 강화 학습 및 OpenAI의 최전선 시스템(예: o3)에서 파생된 기술을 사용해 학습되었습니다.
모델 기능 및 벤치마크
gpt-oss 모델은 추론, 도구 사용, 명령 수행에서 강력한 실제 성능을 제공하며, STEM, 코딩 및 일반 지식 분야에서 특히 뛰어납니다.
성능 비교
- gpt-oss-120b: 핵심 추론 벤치마크에서 OpenAI o4-mini와 거의 동등한 성능을 달성합니다. 경쟁 코딩(Codeforces), 일반 문제 해결(MMLU 및 HLE), 도구 호출(TauBench)에서 o4-mini와 동등하거나 능가합니다. 경쟁 수학(AIME 2024 & 2025) 및 HealthBench를 통한 건강 관련 질의에서는 o4-mini보다 우수합니다.
- gpt-oss-20b: 동일한 평가에서 OpenAI o3-mini와 동등하거나 능가하며, 특히 건강 및 경쟁 수학 분야에서 o3-mini보다 뛰어납니다.
주요 기능
- Reasoning Effort: o-시리즈 모델과 마찬가지로, gpt-oss는 세 가지 추론 노력 수준(낮음, 중간, 높음)을 지원하여 개발자가 시스템 메시지를 통해 지연 시간과 성능을 trade‑off 할 수 있습니다.
- Tool Use: 모델은 파이썬 코드 실행 및 웹 검색을 포함한 few-shot 함수 호출 및 에이전트 워크플로우에서 강력한 능력을 보여줍니다.
- Structured Outputs: 두 모델 모두 Structured Outputs를 지원하며 Responses API와 호환됩니다.
기술 아키텍처
두 gpt-oss 모델은 처리 중 활성 파라미터 수를 최적화하기 위해 Mixture-of-Experts(MoE)와 함께 Transformer 아키텍처를 사용합니다.
| 모델 | 레이어 | 총 파라미터 | 토큰당 활성 파라미터 | 총 전문가 | 토큰당 활성 전문가 | 컨텍스트 길이 |
|---|---|---|---|---|---|---|
| gpt-oss-120b | 36 | 117B | 5.1B | 128 | 4 | 128k |
| gpt-oss-20b | 24 | 21B | 3.6B | 32 | 4 | 128k |
아키텍처 세부 사항
- Attention Mechanism: 모델은 메모리 효율성을 위해 교대로 적용되는 dense와 지역적으로 밴드된 sparse attention 패턴을 사용하고, 그룹화된 multi-query attention(그룹 크기 8)과 결합합니다.
- Positional Encoding: Rotary Positional Embedding(RoPE)를 사용하여 최대 128k 토큰의 네이티브 컨텍스트 길이를 지원합니다.
- Tokenizer: 모델은
o200k_harmony를 사용합니다. 이는 GPT-4o 및 o4-mini에 사용된 토크나이저의 상위 집합이며, OpenAI가 오픈소스로 제공하고 있습니다.
사후 학습 및 체인 오브 씽크
모델은 감독된 파인튜닝 단계와 그 뒤에 고성능 강화 학습(RL) 단계를 거쳐 OpenAI Model Spec에 맞게 정렬되었습니다.
비감독 체인 오브 씽크 (CoT)
OpenAI는 두 모델 모두에 대해 Chain-of-Thought(CoT)에 직접적인 감독을 적용하지 않았습니다. 이러한 설계 선택은 연구자들이 모델의 오작동, 기만 및 오용을 모니터링할 수 있게 합니다. OpenAI는 개발자들에게 CoT를 사용자에게 직접 보여주지 말 것을 권고합니다. CoT에는 환각이나 안전 정책을 위반하는 내용이 포함될 수 있기 때문입니다.
안전 및 위험 완화
안전성은 다단계 학습 및 적대적 테스트를 통해 gpt-oss 릴리즈에 통합되었습니다.
학습 및 정렬
- Pre-training: 화학, 생물학, 방사선 및 핵(CBRN) 위험과 관련된 유해 데이터가 필터링되었습니다.
- Post-training: 신중한 정렬과 명령 계층 구조를 사용하여 프롬프트 인젝션을 방지하고 안전하지 않은 프롬프트에 대한 거부를 보장했습니다.
적대적 파인튜닝
악의적인 파인튜닝 위험을 평가하기 위해 OpenAI는 특수한 생물학 및 사이버 보안 데이터를 사용해 모델의 비거부 버전을 만들었습니다. Preparedness Framework 하에서 테스트한 결과, 이러한 악의적으로 파인튜닝된 모델은 내부 교육 스택을 사용하더라도 높은 능력 수준에 도달하지 못했습니다.
레드 팀
OpenAI는 새로운 안전 문제를 발굴하기 위해 $500,000 상금이 걸린 레드 팀 챌린지를 개최하고 있으며, 결과를 바탕으로 보고서와 오픈소스 평가 데이터셋을 공개할 예정입니다.
가용성 및 배포
가중치는 Hugging Face에서 제공되며, 메모리 요구량을 최소화하기 위해 MXFP4로 네이티브 양자화되었습니다.
- gpt-oss-120b: 80GB 메모리 내에서 실행됩니다(예: 단일 80GB GPU).
- gpt-oss-20b: 메모리 16GB만 필요하여 엣지 디바이스 및 로컬 추론에 적합합니다.
에코시스템 지원
- Software: OpenAI는 Python 및 Rust로 작성된 harmony 렌더러를 오픈소스로 제공했으며, PyTorch와 Apple의 Metal 플랫폼에 대한 참고 구현을 제공했습니다.
- Partners: 배포는 Azure, Hugging Face, vLLM, Ollama, llama.cpp, LM Studio, AWS, Fireworks, Together AI, Baseten, Databricks, Vercel, Cloudflare, OpenRouter 등 주요 플랫폼에서 지원됩니다.
- Hardware: 성능은 NVIDIA, AMD, Cerebras, Groq 하드웨어에 최적화되었습니다.
- Windows Integration: Microsoft는 ONNX Runtime을 통해 Windows 디바이스용 GPU 최적화 버전 gpt-oss-20b를 제공하며, Foundry Local 및 VS Code용 AI Toolkit을 통해 이용할 수 있습니다.
Sources
- OriginalIntroducing gpt-oss