OpenAI o1-preview 版本說明 / 新功能

OpenAI 推出了 o1 系列,一種新型的 AI 模型,設計上會在回應前花更多時間「思考」。這種以推理為核心的架構轉變,使這些模型能夠解決遠比先前版本更為艱深的科學、程式設計與數學問題。

推理能力與效能

OpenAI o1 模型經過訓練,以精進其思考過程、辨識錯誤,並在給出最終答案前嘗試不同策略。此方法在技術領域帶來顯著的效能提升:

  • 數學: 在國際數學奧林匹克(IMO)資格考試中,推理模型取得 83% 的分數,對比 GPT-4o 的 13%。
  • 程式設計: 這些模型在 Codeforces 競賽中達到第 89 百分位。
  • 科學: 在涵蓋物理、化學與生物學的挑戰性基準任務中,最新模型的表現與博士生相當。

對於許多常見任務而言,GPT-4o 在短期內仍較為強大,因為 o1-preview 目前缺乏網頁瀏覽、檔案上傳與影像支援等功能。

安全性與對齊訓練

OpenAI 採用了全新的安全訓練方法,利用模型自身的推理能力來遵循對齊指引。透過在情境中推理安全規則,模型能更有效地套用這些規則。

內部對「越獄」測試(試圖繞過安全規則)的結果顯示出顯著提升:o1-preview 模型在 0-100 分尺度上取得 84 分,而 GPT-4o 只得到 22 分。

為了支援這些能力,OpenAI 整合了以下治理措施:

  • 備妥框架: 嚴謹的測試與評估。
  • 外部合作: 與美國與英國 AI 安全研究所簽訂正式協議,並提供他們模型研究版本的早期存取權。
  • 內部審查: 由安全與保安委員會執行的董事會層級審查程序。

模型變體:o1-preview 與 o1-mini

OpenAI 正發布推理系列的兩個版本,以在效能與效率之間取得平衡:

  • OpenAI o1-preview: 主要的推理模型,設計用於複雜的多步驟問題。
  • OpenAI o1-mini: 更快速、成本更低的替代方案,專為程式設計優化。其成本比 o1-preview 低 80%,適用於需要推理但不需廣泛世界知識的應用。

可用性與存取

o1 系列的存取正逐步在不同層級推出:

  • ChatGPT Plus 與 Team: 透過模型選擇器存取 o1-preview 與 o1-mini。自 2024 年 9 月 17 日起,速率限制為 o1-preview 每週 50 次查詢,o1-mini 每日 50 次查詢。
  • ChatGPT Enterprise 與 Edu: 存取於首次 9 月 12 日發布後的一週開始。
  • 開發者: API 存取對於使用等級 5 的使用者開放,初始速率限制為每分鐘 20 次請求。目前的 API 不支援函式呼叫、串流或系統訊息。
  • 免費使用者: OpenAI 計畫將 o1-mini 的存取權提供給所有 ChatGPT 免費使用者。

未來路線圖

OpenAI 將持續開發 GPT 系列與 o1 系列。對於 o1 模型的未來規劃包括加入網頁瀏覽、檔案上傳與影像上傳功能。

Sources