OpenAI gpt-oss 發行說明

OpenAI 已發布 gpt-oss-120bgpt-oss-20b,兩款最先進的開放權重語言模型,旨在提供高效能推理與高效部署。這些模型在 Apache 2.0 授權下,針對消費者硬體進行了最佳化,並使用強化學習以及來自 OpenAI 前沿系統(包括 o3)的技術進行訓練。

模型能力與基準測試

gpt-oss 模型在推理、工具使用與指令遵循方面展現出強大的實務表現,且在 STEM、程式設計與一般知識方面具備特別的優勢。

效能比較

  • gpt-oss-120b:在核心推理基準測試上與 OpenAI o4-mini 幾乎持平。它在競賽程式設計(Codeforces)、一般問題解決(MMLU 與 HLE)以及工具呼叫(TauBench)上與 o4-mini 相當或超過。於競賽數學(AIME 2024 與 2025)與健康相關查詢(HealthBench)上則優於 o4-mini。
  • gpt-oss-20b:在相同評估上與 OpenAI o3-mini 相當或超過,且在健康與競賽數學方面表現優於 o3-mini。

主要特性

  • Reasoning Effort:與 o 系列模型類似,gpt-oss 支援三種推理努力層級(低、中、高),讓開發者可透過系統訊息在延遲與效能之間取得平衡。
  • Tool Use:模型在少樣本函式呼叫與代理工作流程方面展現出強大能力,包括 Python 程式碼執行與網路搜尋。
  • Structured Outputs:兩個模型皆支援結構化輸出,且相容於 Responses API。

技術架構

兩款 gpt-oss 模型皆採用 Transformer 架構結合 Mixture-of-Experts(MoE),以在處理過程中最佳化活躍參數的數量。

模型 層數 總參數 每個 Token 的活躍參數 總專家數 每個 Token 的活躍專家數 上下文長度
gpt-oss-120b 36 117B 5.1B 128 4 128k
gpt-oss-20b 24 21B 3.6B 32 4 128k

架構細節

  • Attention Mechanism:模型使用交替的密集與局部帶狀稀疏注意力模式,並結合分組多查詢注意力(群組大小為 8)以提升記憶體效率。
  • Positional Encoding:使用 Rotary Positional Embedding(RoPE)以支援最高 128k token 的原生上下文長度。
  • Tokenizer:模型使用 o200k_harmony,它是 GPT-4o 與 o4-mini 所使用的分詞器的超集,且已由 OpenAI 開源。

後訓練與思考鏈(Chain-of-Thought)

模型先經過監督式微調階段,接著進行高運算量的強化學習(RL)階段,以符合 OpenAI Model Spec。

非監督式思考鏈(CoT)

OpenAI 並未對任一模型的思考鏈(CoT)施加直接監督。此設計讓研究人員能監測模型的異常行為、欺騙與濫用。OpenAI 建議開發者不要直接向使用者展示 CoT,因為其中可能包含幻覺或違反安全政策的內容。

安全性與風險緩解

安全性透過多階段訓練與對抗測試納入 gpt-oss 發行中。

訓練與對齊

  • Pre-training:已過濾與化學、生物、放射與核(CBRN)風險相關的有害資料。
  • Post-training:使用深思熟慮的對齊與指令層級,以防止提示注入並確保拒絕不安全的提示。

對抗式微調

為評估惡意微調的風險,OpenAI 使用專門的生物與網路安全資料製作了不拒絕的模型版本。根據 Preparedness Framework 的測試顯示,即使使用 OpenAI 內部的訓練堆疊,這些惡意微調的模型仍無法達到高能力水平。

紅隊測試

OpenAI 正舉辦紅隊挑戰賽,提供 50 萬美元的獎金,以發掘新穎的安全問題,並計畫根據發現發布報告與開源評估資料集。

可用性與部署

模型權重可於 Hugging Face 取得,原生以 MXFP4 量化以降低記憶體需求。

  • gpt-oss-120b:可在 80GB 記憶體內運行(例如單張 80GB GPU)。
  • gpt-oss-20b:僅需 16GB 記憶體,適合邊緣裝置與本地推論。

生態系統支援

  • Software:OpenAI 已以 Python 與 Rust 開源 harmony 渲染器,並提供 PyTorch 與 Apple Metal 平台的參考實作。
  • Partners:部署支援多個主要平台,包括 Azure、Hugging Face、vLLM、Ollama、llama.cpp、LM Studio、AWS、Fireworks、Together AI、Baseten、Databricks、Vercel、Cloudflare 與 OpenRouter。
  • Hardware:效能已針對 NVIDIA、AMD、Cerebras 與 Groq 硬體進行最佳化。
  • Windows Integration:Microsoft 透過 ONNX Runtime 為 Windows 裝置提供 GPU 最佳化的 gpt-oss-20b 版本,可於 Foundry Local 與 VS Code 的 AI Toolkit 取得。

Sources