OpenAI o1-mini 發布說明

OpenAI 已推出 o1-mini,一款專為 STEM 領域設計的推理模型,具備比完整 o1 系列更低的成本與更高的速度。此模型適用於需要複雜推理但不需廣泛通用世界知識的應用。

成本與可用性

o1-mini 供 Tier 5 API 用戶使用,成本比 o1-preview 低 80%。對於 ChatGPT Plus、Team、Enterprise 與 Edu 用戶,o1-mini 作為 o1-preview 的替代方案,提供更高的速率限制與更低的延遲。

STEM 推理效能

o1-mini 是一個較小的模型,在預訓練階段針對 STEM 推理進行優化,並使用與完整 o1 模型相同的高計算強化學習(RL)管線進行訓練。雖然缺乏高容量模型的廣泛世界知識,但在特定技術領域中能達到可比的推理效能。

數學與程式設計

在技術基準測試中,o1-mini 展示了與完整 o1 模型競爭的表現,且在多個領域上超過 o1-preview:

  • Mathematics: 在高中 AIME 數學競賽中,o1-mini 獲得 70.0% 的得分,約位列美國高中生前 500 名。此成績優於 o1-preview(44.6%),且與 o1(74.4%)相當。
  • Coding: 在 Codeforces 上,o1-mini 達到 1650 的 Elo,位列參賽程式設計師的第 86 百分位。此分數高於 o1-preview(1258),且與 o1(1673)相當。該模型在 HumanEval 基準測試以及高中層級的資訊安全 Capture The Flag(CTF)挑戰中也表現良好。

通用 STEM 與人類偏好

o1-mini 在需要推理的學術基準測試(如 MATH-500 與 GPQA(科學))上優於 GPT-4o。然而,在 GPQA 上仍落後於 o1-preview,且因非 STEM 事實知識有限,在 MMLU 上表現不如 GPT-4o。

人類偏好評估顯示,對於以推理為主的領域,使用者較偏好 o1-mini 而非 GPT-4o,但在以語言為重點的任務上則不具優勢。

模型速度與延遲

o1-mini 提供顯著更快的回應時間。於單詞推理測試中,o1-mini 的正確答案取得速度約為 o1-preview 的 3-5 倍,而 GPT-4o 則未能正確回答問題。

安全性與韌性

o1-mini 採用與 o1-preview 相同的對齊與安全技術。使用 StrongREJECT 資料集的內部評估顯示,o1-mini 的越獄韌性比 GPT-4o 高出 59%。

指標 GPT-4o o1-mini
% 對有害提示(標準)的安全完成拒絕率 0.99 0.99
% 對有害提示(挑戰:越獄與邊緣案例)的安全完成率 0.714 0.932
% 對良性邊緣案例的合規率 0.91 0.923
Goodness@0.1 StrongREJECT 越獄評估 0.22 0.83
人工來源越獄評估 0.77 0.95

限制

由於 o1-mini 專注於 STEM,其對非 STEM 主題(包括傳記、日期與一般雜項)的事實知識僅相當於較小的模型,如 GPT-4o mini。OpenAI 計畫在未來版本中解決這些限制,並探索向其他模態與專業領域的擴展。

Sources