OpenAI gpt-oss Ollama 출시

Ollama와 OpenAI는 gpt-oss 오픈 웨이트 모델을 Ollama 플랫폼으로 가져오기 위해 협력하여, 최첨단 추론 및 에이전트 모델의 로컬 실행을 가능하게 합니다. 이번 출시는 다양한 개발자 사용 사례와 고도의 추론 작업을 위해 설계된 20B 및 120B 파라미터의 두 가지 모델 크기를 도입합니다.

핵심 역량 및 기능

gpt-oss 모델은 에이전트 워크플로우와 투명한 추론 프로세스에 대한 네이티브 지원을 제공합니다. 주요 기능은 다음과 같습니다:

  • 에이전트 역량: 모델은 함수 호출(function calling), python 도구 호출, 그리고 구조화된 출력을 네이티브로 지원합니다. Ollama는 모델에 실시간 정보를 보강하기 위해 선택 가능한 내장 웹 검색 기능을 제공합니다.
  • 전체 사고 과정(Full Chain-of-Thought): 사용자는 모델의 내부 추론 프로세스에 완전히 접근할 수 있으며, 이는 출력의 신뢰도를 높이고 디버깅을 단순화하기 위해 의도되었습니다.
  • 구성 가능한 추론 노력(Configurable Reasoning Effort): 특정 사용 사례에 따라 지연 시간과 성능의 균형을 맞추기 위해 추론 노력을 낮음, 중간, 높음 설정 사이에서 조정할 수 있습니다.
  • 커스터마이징 및 라이선스: 모델은 파라미터 미세 조정(fine-tuning)을 통해 완전히 미세 조정이 가능하며, 허용적인 Apache 2.0 라이선스 하에 출시되어 카피레프트 제한 없이 상업적 배포 및 실험이 가능합니다.

모델 변체 및 하드웨어 요구 사항

다양한 성능 및 하드웨어 제약 조건에 맞게 두 가지 버전의 gpt-oss를 사용할 수 있습니다:

  • gpt-oss-20b: 낮은 지연 시간과 특화된 로컬 사용 사례에 최적화된 200억 파라미터 모델입니다.
  • gpt-oss-120b: 범용적인 고도의 추론 프로덕션 작업을 위해 설계된 1200억 파라미터 모델입니다.

기술적 구현: MXFP4 양자화

메모리 사용량을 줄이기 위해, OpenAI는 전체 파라미터 수의 90% 이상을 차지하는 mixture-of-experts (MoE) 가중치에 MXFP4 양자화 형식을 사용합니다. 이 형식에서 가중치는 파라미터당 4.25비트로 양자화됩니다.

이 양자화는 다음과 같은 하드웨어 접근성을 가능하게 합니다:

  • 20B 모델은 16GB의 메모리만 있는 시스템에서도 실행할 수 있습니다.
  • 120B 모델은 단일 80GB GPU에 들어갈 수 있습니다.

Ollama는 추가적인 변환 없이 MXFP4 형식을 네이티브로 지원하기 위해 엔진을 위한 새로운 커널을 개발했습니다. Ollama는 OpenAI와 협력하여 품질의 동등성을 보장하기 위해 이러한 구현을들을 참조 버전과 벤치마크하여 비교했습니다.

NVIDIA와의 하드웨어 가속

Ollama와 NVIDIA는 NVIDIA GeForce RTX 및 RTX PRO GPU에 특화하여 gpt-oss 성능을 최적화하기 위해 협력했습니다. 이 파트너십을 통해 RTX 기반 PC를 사용하는 사용자는 gpt-oss 모델의 모든 기능을 정확하게 활용할 수 있습니다.

배포

모델은 최신 버전의 Ollama 애플리케이션을 통해 배포하거나 터미널에서 다음 명령어를 사용하여 배포할 수 있습니다:

ollama run gpt-oss:20b

ollama run gpt-oss:120b

Sources

관련

  • 프로젝트
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch