OpenAI gpt-oss Ollamaでのリリース
OllamaとOpenAIは、gpt-ossオープンウェイトモデルをOllamaプラットフォームに導入するために提携しました。これにより、最先端の推論およびエージェント型モデルのローカル実行が可能になります。今回のリリースでは、開発者の多様なユースケースや高度な推論タスク向けに設計された、20Bおよび120Bパラメータの2つのモデルサイズが導入されます。
コア機能と特徴
gpt-ossモデルは、エージェント型ワークフローと透明性の高い推論プロセスをネイティブにサポートしています。主な特徴は以下の通りです:
- エージェント機能: モデルは、function calling、python tool calls、および構造化された出力をネイティブにサポートしています。Ollamaは、モデルをリアルタイム情報で補完するためのオプションの組み込みウェブ検索機能を提供します。
- 完全なChain-of-Thought: ユーザーはモデルの内部推論プロセスに完全にアクセスでき、これにより出力の信頼性を高め、デバッグを簡素化することを目的としています。
- 設定可能な推論負荷: 推論負荷は、低、中、高の設定間で調整可能であり、特定のユースケースに基づいてレイテンシとパフォーマンスのバランスを最適化できます。
- カスタマイズとライセンス: モデルはパラメータ・ファインチューニングを通じて完全にファインチューニング可能であり、Apache 2.0ライセンスの下でリリースされるため、コピーレフトの制限なしに商用展開や実験が可能です。
モデルのバリエーションとハードウェア要件
パフォーマンスとハードウェアの制約に合わせて、2つのgpt-ossバージョンが利用可能です:
- gpt-oss-20b: 低レイテンシおよび特化型のローカルユースケース向けに最適化された200億パラメータのモデル。
- gpt-oss-120b: 汎用および高度な推論を必要とするプロダクションタスク向けに設計された1200億パラメータのモデル。
技術的実装:MXFP4量子化
メモリ使用量を削減するため、OpenAIは、全パラメータ数の90%以上を占めるmixture-of-experts (MoE) の重みにMXFP4量子化フォーマットを利用しています。このフォーマットでは、重みはパラメータあたり4.25ビットに量子化されます。
この量子化により、以下のハードウェアアクセシビリティが実現します:
- 20Bモデルは、わずか16GBのメモリを搭載したシステムで実行可能です。
- 120Bモデルは、単一の80GB GPUに収まります。
Ollamaは、そのエンジン向けにMXFP4フォーマットをネイティブにサポートするための新しいカーネルを開発し、追加の変換を必要としないようにしました。OllamaはOpenAIと協力し、これらの実装をリファレンスバージョンと比較してベンチマークを行い、品質の同等性を確保しました。
NVIDIAによるハードウェア加速
OllamaとNVIDIAは、gpt-ossのパフォーマンスを、特にNVIDIA GeForce RTXおよびRTX PRO GPU向けに最適化するために協力しました。この提携により、RTX搭載PCを使用するユーザーは、gpt-ossモデルの全機能を正確に活用できるようになります。
デプロイメント
モデルは、最新バージョンのOllamaアプリケーション、または以下のコマンドを使用してターミナルからデプロイできます:
ollama run gpt-oss:20b
ollama run gpt-oss:120b
Sources
- OriginalOpenAI gpt-oss
関連
- プロジェクト
- Dispatch
- Dispatch
- Dispatch
- Dispatch