OpenAI gpt-oss-120b 與 gpt-oss-20b 發布

OpenAI 已發布 gpt-oss-120b 與 gpt-oss-20b,兩款為代理式工作流程設計的開放權重推理模型。這些模型在 Apache 2.0 授權與 gpt-oss 使用政策下提供,為開源社群提供強大的指令遵循、工具使用以及可自訂的推理努力等工具。

模型能力與整合

gpt-oss 模型是僅文字的推理模型,支援結構化輸出並提供完整的思考鏈(CoT)可視化。它們設計用於整合到代理式工作流程中,特別支援如 Python 程式碼執行與網路搜尋等工具使用。

  • 可自訂性:模型可依特定需求進行自訂。
  • 指令遵循:在遵循複雜指令方面具備強大能力。
  • 推理努力:使用者可調整推理努力,以應對不需要複雜推理的任務。
  • API 相容性:模型相容於 OpenAI Responses API。

安全性與風險評估

由於開放權重模型可能被第三方微調以繞過安全拒絕,OpenAI 將其視為與專有模型不同的風險輪廓。OpenAI 指出,實作這些模型的開發者與企業需要自行實施系統層級的防護,以複製 OpenAI 專有 API 產品中所具備的保護機制。

為評估這些模型的風險,OpenAI 使用其備援框架對 gpt-oss-120b 進行了可擴展的能力評估。評估聚焦於三個追蹤類別:生物與化學能力、網路能力以及 AI 自我改進。結果證實,預設模型在這些類別中皆未達到「高能力」的門檻。

對抗測試與開放模型前沿

OpenAI 進行了對抗性微調模擬,以判斷攻擊者是否能將 gpt-oss-120b 修改至在生物與化學或網路領域達到高能力。

  • 對抗性微調:即使使用 OpenAI 的訓練堆疊進行強化微調,gpt-oss-120b 仍未在生物與化學風險或網路風險方面達到高能力。
  • 與現有模型比較:gpt-oss-120b 的發布並未顯著推進開放基礎模型在生物能力方面的前沿,因為現有開放模型的預設表現常常與對抗性微調後的 gpt-oss-120b 表現相當。

OpenAI 表示,此次發布是其致力於推動有益 AI 並提升整個 AI 生態系統安全標準的承諾之一。

Sources