OpenAI o3-mini 發佈說明 / 新功能介紹
OpenAI o3-mini 是一款針對 STEM(科學、數學與程式設計)優化的高成本效益推理模型,在提供與較大型 OpenAI o1 模型相當的性能之餘,同時保持了 o1-mini 的低成本與低延遲特性。目前已在 ChatGPT 中推出,並透過 API 向特定開發者開放。
STEM 推理與性能
OpenAI o3-mini 是專為需要高精準度與高速度的技術領域而設計。在「medium」推理強度下,它在數學、程式設計與科學方面的表現與 OpenAI o1 相當。
技術基準測試
- 數學:在 AIME 2024 評估中,使用 medium 強度的 o3-mini 與 o1 表現相當,而使用 high 推理強度則能超越 o1 與 o1-mini。
- 博士級科學:在 GPQA Diamond 基準測試(生物、化學與物理)中,使用 low 強度的 o3-mini 已超越 o1-mini,而使用 high 強度則與 o1 旗鼓相當。
- 研究級數學:在 FrontierMath 上,使用 high 推理強度並搭配 Python 工具的 o3-mini 在首次嘗試時即可解決超過 32% 的問題,其中包括超過 28% 的挑戰性 T3 問題。
- 競賽程式設計:在 Codeforces 上,o3-mini 在所有推理強度等級下均優於 o1-mini,並在 medium 強度下達到與 o1 相當的性能。
- 軟體工程:o3-mini 是 OpenAI 在 SWE-bench Verified (n=477) 上表現最高的已發佈模型。透過內部工具框架,它達到了 61% 的成功率。
- LiveBench Coding:即使在 medium 推理強度下,o3-mini 也超越了 o1-high。
人類偏好與準確度
外部專家測試者在 56% 的情況下更偏好 o3-mini 的回答而非 o1-mini,並報告在處理困難的現實問題時,重大錯誤減少了 39%。
模型速度與效率
OpenAI o3-mini 較其前身 o1-mini 有顯著的延遲改善。在 A/B 測試中,o3-mini 的回應速度比 o1-mini 快 24%,平均回應時間為 7.7 秒,而 o1-mini 為 10.16 秒。此外,o3-mini 的平均首個 token 生成時間比 o1-mini 快了 2,500ms。
開發者功能與 API 整合
OpenAI o3-mini 是第一個支援多項生產就緒開發者功能的小型推理模型:
- Function Calling:支援將模型與外部工具整合。
- Structured Outputs:確保模型遵循特定的 JSON schemas。
- Developer Messages:增強了系統級指令的提示能力。
- Reasoning Effort:開發者可以根據特定使用場景,在 low、medium 與 high 推理強度之間進行選擇,以平衡速度與智慧。
- Streaming:支援串流回應,與 o1-mini 和 o1-preview 保持一致。
注意:o3-mini 不支援視覺功能;視覺推理任務應繼續由 OpenAI o1 處理。
可用性與存取權限
- ChatGPT Plus, Team, and Pro:立即可用。Pro 用戶可以無限次使用
o3-mini與o3-mini-high。 - 免費用戶:推理模型首次透過訊息輸入框中的「Reason」選項提供給免費用戶使用。
- 企業版:預計於二月開放存取。
- API:正透過 Chat Completions、Assistants 與 Batch APIs 向使用層級為 3-5 的開發者逐步推出。
- 速率限制:Plus 與 Team 用戶的速率限制已從每天 50 則訊息 (o1-mini) 增加至每天 150 則訊息 (o3-mini)。
安全性與對齊
OpenAI 使用「審議式對齊」(deliberative alignment)來訓練 o3-mini,這是一個讓模型在生成回應前先對人類編寫的安全規範進行推理的過程。這種方法使 o3-mini 在具挑戰性的安全性與越獄(jailbreak)評估中顯著超越 GPT-4o。該模型經過了外部紅隊測試與安全性評估,其方式與 OpenAI o1 所採用的準備就緒方法一致。
Sources
- OriginalOpenAI o3-mini