OpenAI o3-mini リリースノート / 新機能

OpenAI o3-miniは、STEM(科学、数学、コーディング)に最適化されたコスト効率の高い推論モデルで、より大きなOpenAI o1モデルと同等のパフォーマンスを提供しながら、o1-miniの低コストと低レイテンシを維持しています。現在、ChatGPTおよび選択された開発者向けのAPIで利用可能です。

STEM 推論とパフォーマンス

OpenAI o3-miniは、高い精度と速度を必要とする技術分野のために特別に設計されています。「medium」の推論努力では、数学、コーディング、科学においてOpenAI o1のパフォーマンスに匹敵します。

テクニカルベンチマーク

  • Mathematics: AIME 2024 の評価では、medium の推論努力での o3-mini は o1 と匹敵し、high の推論努力では o1 および o1-mini を上回る性能を発揮します。
  • PhD-level Science: GPQA Diamond ベンチマーク(生物学、化学、物理学)において、low の推論努力での o3-mini は既に o1-mini を上回り、high の推論努力では o1 と同等の性能に達します。
  • Research-level Math: FrontierMath では、high の推論努力と Python ツールを使用した o3-mini は、最初の試みで問題の 32% 以上を解決し、その中には挑戦的な T3 問題の 28% 以上も含まれます。
  • Competitive Coding: Codeforces では、o3-mini はすべての推論努力レベルで o1-mini を上回り、medium の推論努力では o1 のパフォーマンスに匹敵します。
  • Software Engineering: o3-mini は SWE-bench Verified(n=477)において OpenAI がリリースしたモデルの中で最高のパフォーマンスを発揮します。内部ツールのスキャフォールドを使用することで、成功率 61% を達成します。
  • LiveBench Coding: o3-mini は medium の推論努力でも o1-high を上回ります。

人間の好みと精度

外部の専門テスターは、o3-mini の回答を o1-mini の回答よりも 56% の時間で好み、難しい実際の世界の質問における重大なエラーが 39% 減少したと報告しました。

モデルの速度と効率

OpenAI o3-mini は、前身である o1-mini と比較してレイテンシの大幅な改善を提供します。A/B テストでは、o3-mini の応答は o1-mini より 24% 高速で、平均応答時間は 7.7 秒(o1-mini は 10.16 秒)でした。さらに、o3-mini の最初のトークンまでの平均時間は o1-mini より 2,500ms 速いです。

開発者機能と API 統合

OpenAI o3-mini は、いくつかの本番環境対応の開発者機能をサポートする最初の小規模推論モデルです:

  • Function Calling: 外部ツールとの統合をサポートします。
  • Structured Outputs: モデルが特定の JSON スキーマに準拠することを保証します。
  • Developer Messages: システムレベルの指示のためのプロンプト機能が強化されます。
  • Reasoning Effort: 開発者は、特定のユースケースに応じて速度と知能のバランスを取るために、low、medium、high の推論努力から選択できます。
  • Streaming: o1-mini および o1-preview と一貫したストリーミング応答のサポート。

注: o3-mini は視覚機能をサポートしていません;視覚的推論タスクは引き続き OpenAI o1 が処理すべきです。

可用性とアクセス

  • ChatGPT Plus, Team, and Pro: すぐに利用可能です。Pro ユーザーは、o3-minio3-mini-high の両方に無制限にアクセスできます。
  • Free Users: 初めて、理由付けモデルがメッセージ作成者の 'Reason' オプションを通じて ChatGPT の無料ユーザーにも利用可能になりました。
  • Enterprise: 2月にアクセスが予定されています。
  • API: Chat Completions、Assistants、Batch API を通じて、使用階層 3-5 の開発者に順次提供されます。
  • Rate Limits: PlusおよびTeamユーザーのレート制限は、o1-mini の 1日あたり50メッセージから o3-mini の 1日あたり150メッセージに3倍に増加されました。

セーフティとアライメント

OpenAI は、「deliberative alignment」を用いて o3-mini を訓練しました。これは、応答を生成する前に人間が書いた安全仕様についてモデルが推論するプロセスです。このアプローチにより、o34-mini は難しい安全およびジェイルブレイク評価において GPT-4o を大幅に上回ることができます。このモデルは、OpenAI o1 で使用された準備アプローチと一貫した外部のレッドチーム演習および安全評価を受けました。

Sources