OpenAI o3-mini 发布说明 / 新功能概览

OpenAI o3-mini 是一个针对 STEM(科学、数学和编程)优化的高效推理模型,在保持 o1-mini 的低成本和低延迟的同时,提供与更大的 OpenAI o1 模型相当的性能。它目前在 ChatGPT 和通过 API 向选定的开发者提供。

STEM 推理与性能

OpenAI o3-mini 专门针对需要高精度和高速度的技术领域进行设计。在使用 "medium" 推理强度时,它在数学、编码和科学方面的性能与 OpenAI o1 相当。

技术基准

  • Mathematics: 在 AIME 2024 评估中,o3-mini 在 medium 努力下与 o1 相当,而高推理努力使其能够超越 o1 和 o1-mini。
  • PhD-level Science: 在 GPQA Diamond 基准测试(生物学、化学和物理学)中,o3-mini 在 low 努力下已经超过了 o1-mini,而在 high 努力下,它达到与 o1 相当的水平。
  • Research-level Math: 在 FrontierMath 上,o3-mini 在高推理努力并使用 Python 工具的情况下,首次尝试即可解决超过 32% 的问题,包括超过 28% 的具有挑战性的 T3 问题。
  • Competitive Coding: 在 Codeforces 上,o3-mini 在所有推理努力水平上均优于 o1-mini,并在 medium 努力下与 o1 的性能相当。
  • Software Engineering: o3-mini 是 OpenAI 在 SWE-bench Verified(n=477)上表现最高的已发布模型。使用内部工具脚手架,它实现了 61% 的成功率。
  • LiveBench Coding: o3 Coding**: o3-mini 即使在 medium 推理努力下也能超越 o1-high。

人类偏好与准确度

外部专家测试者在 56% 的时间里更倾向于 o3-mini 的回答而非 o1-mini,并且报告在困难的真实世界问题上主要错误减少了 39%。

模型速度与效率

OpenAI o3-mini 相较于其前身 o1-mini 提供了显著的延迟改进。在 A/B 测试中,o3-mini 的响应速度比 o1-mini 快 24%,平均响应时间为 7.7 秒,而 o1-mini 为 10.16 秒。此外,o3-mini 的首个 token 的平均时间比 o1-mini 快 2,500毫秒。

开发者功能与 API 集成

OpenAI o3-mini 是首个支持多个生产就绪开发者功能的小型推理模型:

  • Function Calling: 支持将模型与外部工具集成。
  • Structured Outputs: 确保模型遵循特定的 JSON 模式。
  • Developer Messages: 增强的系统级指令提示能力。
  • Reasoning Effort: 开发者可以在 low、medium 和 high 推理努力之间进行选择,以在特定用例中平衡速度和智能。
  • Streaming: 支持流式响应,与 o1-mini 和 o1-preview 一致。

注意:o3-mini 不支持视觉能力;视觉推理任务应继续由 OpenAI o1 处理。

可用性与访问

  • ChatGPT Plus, Team, and Pro: 立即可用。Pro 用户可以无限制访问 o3-minio3-mini-high
  • Free Users: 首次,推理模型通过 ChatGPT 消息撰写器中的 'Reason' 选项向免费用户提供。
  • Enterprise: 访问计划于 二月 提供。
  • API: 正在通过 Chat Completions、Assistants 和 Batch APIs 向使用等级 3-5 的开发者逐步推出。
  • Rate Limits: Plus 和 Team 用户的速率限制已从每天 50 条消息(o1-mini)提高三倍至每天 150 条消息(o3-mini)。

安全与对齐

OpenAI 使用了 "deliberative alignment" 来训练 o3-mini,这是一种在生成响应之前让模型推理人类编写的安全规范的过程。这种方法使 o3-mini 在具有挑战性的安全和越狱评估中显著超越了 GPT-4o。该模型经过了外部红队测试和安全评估,这些评估与用于 OpenAI o1 的准备就绪方法保持一致。

Sources