OpenAI gpt-oss 在 Ollama 上發佈

Ollama 與 OpenAI 已達成合作,將 gpt-oss 開放權重模型引入 Ollama 平台,實現最先進的推理與代理型(agentic)模型的本地執行。此次發佈推出了兩種模型規模——20B 與 120B 參數——旨在滿足開發者多樣化的使用場景與高推理任務需求。

核心能力與功能

gpt-oss 模型原生支持代理型工作流與透明的推理過程。關鍵功能包括:

  • 代理型能力: 模型原生支持函數調用(function calling)、python 工具調用以及結構化輸出。Ollama 提供可選的內置網頁搜索功能,以利用即時資訊來增強模型能力。
  • 完整思維鏈(Full Chain-of-Thought): 用戶可以完全訪問模型的內部推理過程,旨在提高輸出結果的可信度並簡化除錯流程。
  • 可配置的推理強度: 推理強度可在低、中、高設置之間進行調整,以便根據特定使用場景在延遲與性能之間取得平衡。
  • 自定義與授權: 模型可通過參數微調進行完全微調,並根據寬鬆的 Apache 2.0 許可證發佈,允許在沒有 copyleft 限制的情況下進行商業部署與實驗。

模型變體與硬體需求

提供兩種版本的 gpt-oss 以適應不同的性能與硬體限制:

  • gpt-oss-20b: 一款 200 億參數的模型,針對低延遲與特定本地使用場景進行了優化。
  • gpt-oss-120b: 一款 1200 億參數的模型,專為通用型、高推理能力的生產環境任務而設計。

技術實現:MXFP4 量化

為了減少記憶體占用,OpenAI 對佔總參數數量 90% 以上的混合專家模型(MoE)權重使用了 MXFP4 量化格式。在此格式中,權重被量化為每參數 4.25 bits。

這種量化技術實現了以下硬體可及性:

  • 20B 模型可以在僅有 16GB 記憶體的系統上運行。
  • 120B 模型可以容納在單張 80GB GPU 上。

Ollama 開發了新的內核(kernels)以使其引擎原生支持 MXFP4 格式,從而避免了額外的轉換需求。Ollama 與 OpenAI 合作,將這些實現與參考版本進行基準測試,以確保品質一致。

使用 NVIDIA 硬體加速

Ollama 與 NVIDIA 合作優化了 gpt-oss 的性能,特別針對 NVIDIA GeForce RTX 與 RTX PRO GPU 進行了優化。此合作夥伴關係確保了使用 RTX 系列 PC 的用戶可以精確地利用 gpt-oss 模型的完整能力。

部署

模型可以通過最新版本的 Ollama 應用程式或通過終端機使用以下命令進行部署:

ollama run gpt-oss:20b

ollama run gpt-oss:120b

Sources

相關

  • 專案
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch