OpenAI gpt-oss 發行說明
OpenAI 已發布 gpt-oss-120b 與 gpt-oss-20b,兩款最先進的開放權重語言模型,旨在提供高效能推理與高效部署。這些模型在 Apache 2.0 授權下,針對消費者硬體進行了最佳化,並使用強化學習以及來自 OpenAI 前沿系統(包括 o3)的技術進行訓練。
模型能力與基準測試
gpt-oss 模型在推理、工具使用與指令遵循方面展現出強大的實務表現,且在 STEM、程式設計與一般知識方面具備特別的優勢。
效能比較
- gpt-oss-120b:在核心推理基準測試上與 OpenAI o4-mini 幾乎持平。它在競賽程式設計(Codeforces)、一般問題解決(MMLU 與 HLE)以及工具呼叫(TauBench)上與 o4-mini 相當或超過。於競賽數學(AIME 2024 與 2025)與健康相關查詢(HealthBench)上則優於 o4-mini。
- gpt-oss-20b:在相同評估上與 OpenAI o3-mini 相當或超過,且在健康與競賽數學方面表現優於 o3-mini。
主要特性
- Reasoning Effort:與 o 系列模型類似,gpt-oss 支援三種推理努力層級(低、中、高),讓開發者可透過系統訊息在延遲與效能之間取得平衡。
- Tool Use:模型在少樣本函式呼叫與代理工作流程方面展現出強大能力,包括 Python 程式碼執行與網路搜尋。
- Structured Outputs:兩個模型皆支援結構化輸出,且相容於 Responses API。
技術架構
兩款 gpt-oss 模型皆採用 Transformer 架構結合 Mixture-of-Experts(MoE),以在處理過程中最佳化活躍參數的數量。
| 模型 | 層數 | 總參數 | 每個 Token 的活躍參數 | 總專家數 | 每個 Token 的活躍專家數 | 上下文長度 |
|---|---|---|---|---|---|---|
| gpt-oss-120b | 36 | 117B | 5.1B | 128 | 4 | 128k |
| gpt-oss-20b | 24 | 21B | 3.6B | 32 | 4 | 128k |
架構細節
- Attention Mechanism:模型使用交替的密集與局部帶狀稀疏注意力模式,並結合分組多查詢注意力(群組大小為 8)以提升記憶體效率。
- Positional Encoding:使用 Rotary Positional Embedding(RoPE)以支援最高 128k token 的原生上下文長度。
- Tokenizer:模型使用
o200k_harmony,它是 GPT-4o 與 o4-mini 所使用的分詞器的超集,且已由 OpenAI 開源。
後訓練與思考鏈(Chain-of-Thought)
模型先經過監督式微調階段,接著進行高運算量的強化學習(RL)階段,以符合 OpenAI Model Spec。
非監督式思考鏈(CoT)
OpenAI 並未對任一模型的思考鏈(CoT)施加直接監督。此設計讓研究人員能監測模型的異常行為、欺騙與濫用。OpenAI 建議開發者不要直接向使用者展示 CoT,因為其中可能包含幻覺或違反安全政策的內容。
安全性與風險緩解
安全性透過多階段訓練與對抗測試納入 gpt-oss 發行中。
訓練與對齊
- Pre-training:已過濾與化學、生物、放射與核(CBRN)風險相關的有害資料。
- Post-training:使用深思熟慮的對齊與指令層級,以防止提示注入並確保拒絕不安全的提示。
對抗式微調
為評估惡意微調的風險,OpenAI 使用專門的生物與網路安全資料製作了不拒絕的模型版本。根據 Preparedness Framework 的測試顯示,即使使用 OpenAI 內部的訓練堆疊,這些惡意微調的模型仍無法達到高能力水平。
紅隊測試
OpenAI 正舉辦紅隊挑戰賽,提供 50 萬美元的獎金,以發掘新穎的安全問題,並計畫根據發現發布報告與開源評估資料集。
可用性與部署
模型權重可於 Hugging Face 取得,原生以 MXFP4 量化以降低記憶體需求。
- gpt-oss-120b:可在 80GB 記憶體內運行(例如單張 80GB GPU)。
- gpt-oss-20b:僅需 16GB 記憶體,適合邊緣裝置與本地推論。
生態系統支援
- Software:OpenAI 已以 Python 與 Rust 開源 harmony 渲染器,並提供 PyTorch 與 Apple Metal 平台的參考實作。
- Partners:部署支援多個主要平台,包括 Azure、Hugging Face、vLLM、Ollama、llama.cpp、LM Studio、AWS、Fireworks、Together AI、Baseten、Databricks、Vercel、Cloudflare 與 OpenRouter。
- Hardware:效能已針對 NVIDIA、AMD、Cerebras 與 Groq 硬體進行最佳化。
- Windows Integration:Microsoft 透過 ONNX Runtime 為 Windows 裝置提供 GPU 最佳化的 gpt-oss-20b 版本,可於 Foundry Local 與 VS Code 的 AI Toolkit 取得。
Sources
- OriginalIntroducing gpt-oss