OpenAI gpt-oss 在 Ollama 上發佈
Ollama 與 OpenAI 已達成合作,將 gpt-oss 開放權重模型引入 Ollama 平台,實現最先進的推理與代理型(agentic)模型的本地執行。此次發佈推出了兩種模型規模——20B 與 120B 參數——旨在滿足開發者多樣化的使用場景與高推理任務需求。
核心能力與功能
gpt-oss 模型原生支持代理型工作流與透明的推理過程。關鍵功能包括:
- 代理型能力: 模型原生支持函數調用(function calling)、python 工具調用以及結構化輸出。Ollama 提供可選的內置網頁搜索功能,以利用即時資訊來增強模型能力。
- 完整思維鏈(Full Chain-of-Thought): 用戶可以完全訪問模型的內部推理過程,旨在提高輸出結果的可信度並簡化除錯流程。
- 可配置的推理強度: 推理強度可在低、中、高設置之間進行調整,以便根據特定使用場景在延遲與性能之間取得平衡。
- 自定義與授權: 模型可通過參數微調進行完全微調,並根據寬鬆的 Apache 2.0 許可證發佈,允許在沒有 copyleft 限制的情況下進行商業部署與實驗。
模型變體與硬體需求
提供兩種版本的 gpt-oss 以適應不同的性能與硬體限制:
- gpt-oss-20b: 一款 200 億參數的模型,針對低延遲與特定本地使用場景進行了優化。
- gpt-oss-120b: 一款 1200 億參數的模型,專為通用型、高推理能力的生產環境任務而設計。
技術實現:MXFP4 量化
為了減少記憶體占用,OpenAI 對佔總參數數量 90% 以上的混合專家模型(MoE)權重使用了 MXFP4 量化格式。在此格式中,權重被量化為每參數 4.25 bits。
這種量化技術實現了以下硬體可及性:
- 20B 模型可以在僅有 16GB 記憶體的系統上運行。
- 120B 模型可以容納在單張 80GB GPU 上。
Ollama 開發了新的內核(kernels)以使其引擎原生支持 MXFP4 格式,從而避免了額外的轉換需求。Ollama 與 OpenAI 合作,將這些實現與參考版本進行基準測試,以確保品質一致。
使用 NVIDIA 硬體加速
Ollama 與 NVIDIA 合作優化了 gpt-oss 的性能,特別針對 NVIDIA GeForce RTX 與 RTX PRO GPU 進行了優化。此合作夥伴關係確保了使用 RTX 系列 PC 的用戶可以精確地利用 gpt-oss 模型的完整能力。
部署
模型可以通過最新版本的 Ollama 應用程式或通過終端機使用以下命令進行部署:
ollama run gpt-oss:20b
ollama run gpt-oss:120b
Sources
- OriginalOpenAI gpt-oss
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- Dispatch