OpenAI 估算開放權重大型語言模型的最壞情境前沿風險

TL;DR

OpenAI 發布了一項關於 gpt-oss 風險評估的技術研究,結論指出,與現有的開放權重模型相比,該模型並未顯著推進生物或網路安全風險的前沿。該研究使用了一種稱為惡意微調 (MFT) 的流程,測試模型在這兩個高風險領域的最壞情境能力。

惡意微調 (MFT) 方法論

為了估算最壞情境的風險,OpenAI 研究人員使用惡意微調 (MFT) 故意引發 gpt-oss 在生物學與網路安全領域的最大可能能力。此方法讓研究人員能判斷模型的架構或權重是否本質上比其預設狀態更具危害性。

生物風險 (Biorisk) 評估

為了最大化生物風險,研究人員策劃了一組與威脅創造相關的任務。接著,他們在具備網頁瀏覽功能的強化學習 (RL) 環境中訓練 gpt-oss,使模型能模擬其協助威脅創造過程的潛力。

網路安全風險評估

為了最大化網路安全風險,gpt-oss 在一個專門設計用於解決 Capture-the-Flag (CTF) 挑戰的代理程式編碼環境中進行訓練。此模型變體旨在評估模型自動化複雜網路安全攻擊的潛力。

比較性能與風險發現

OpenAI 將經 MFT 增強的 gpt-oss 模型與封閉權重與開放權重的大型語言模型進行比較。評估結果顯示如下:

  • 與封閉權重模型的比較: MFT gpt-oss 的表現不如 OpenAI o3,該模型目前在生物風險與網路安全兩項上皆被評為低於「備援高能力等級」。
  • 與開放權重模型的比較: 雖然 gpt-oss 可能略微提升生物能力,但相較於已公開的現有開放權重模型,並未顯著推進風險的前沿。

模型釋出的影響

MFT 流程的發現提供了 OpenAI 決定釋出模型所需的關鍵證據。透過證明即使在惡意微調下,模型亦未達到危險的臨界門檻,OpenAI 旨在提供一個框架,以估算未來前沿模型開放權重釋放可能造成的傷害。

Sources