OpenAI o3-mini 发布说明 / 新功能概览
OpenAI o3-mini 是一个针对 STEM(科学、数学和编程)优化的高效推理模型,在保持 o1-mini 的低成本和低延迟的同时,提供与更大的 OpenAI o1 模型相当的性能。它目前在 ChatGPT 和通过 API 向选定的开发者提供。
STEM 推理与性能
OpenAI o3-mini 专门针对需要高精度和高速度的技术领域进行设计。在使用 "medium" 推理强度时,它在数学、编码和科学方面的性能与 OpenAI o1 相当。
技术基准
- Mathematics: 在 AIME 2024 评估中,o3-mini 在 medium 努力下与 o1 相当,而高推理努力使其能够超越 o1 和 o1-mini。
- PhD-level Science: 在 GPQA Diamond 基准测试(生物学、化学和物理学)中,o3-mini 在 low 努力下已经超过了 o1-mini,而在 high 努力下,它达到与 o1 相当的水平。
- Research-level Math: 在 FrontierMath 上,o3-mini 在高推理努力并使用 Python 工具的情况下,首次尝试即可解决超过 32% 的问题,包括超过 28% 的具有挑战性的 T3 问题。
- Competitive Coding: 在 Codeforces 上,o3-mini 在所有推理努力水平上均优于 o1-mini,并在 medium 努力下与 o1 的性能相当。
- Software Engineering: o3-mini 是 OpenAI 在 SWE-bench Verified(n=477)上表现最高的已发布模型。使用内部工具脚手架,它实现了 61% 的成功率。
- LiveBench Coding: o3 Coding**: o3-mini 即使在 medium 推理努力下也能超越 o1-high。
人类偏好与准确度
外部专家测试者在 56% 的时间里更倾向于 o3-mini 的回答而非 o1-mini,并且报告在困难的真实世界问题上主要错误减少了 39%。
模型速度与效率
OpenAI o3-mini 相较于其前身 o1-mini 提供了显著的延迟改进。在 A/B 测试中,o3-mini 的响应速度比 o1-mini 快 24%,平均响应时间为 7.7 秒,而 o1-mini 为 10.16 秒。此外,o3-mini 的首个 token 的平均时间比 o1-mini 快 2,500毫秒。
开发者功能与 API 集成
OpenAI o3-mini 是首个支持多个生产就绪开发者功能的小型推理模型:
- Function Calling: 支持将模型与外部工具集成。
- Structured Outputs: 确保模型遵循特定的 JSON 模式。
- Developer Messages: 增强的系统级指令提示能力。
- Reasoning Effort: 开发者可以在 low、medium 和 high 推理努力之间进行选择,以在特定用例中平衡速度和智能。
- Streaming: 支持流式响应,与 o1-mini 和 o1-preview 一致。
注意:o3-mini 不支持视觉能力;视觉推理任务应继续由 OpenAI o1 处理。
可用性与访问
- ChatGPT Plus, Team, and Pro: 立即可用。Pro 用户可以无限制访问
o3-mini和o3-mini-high。 - Free Users: 首次,推理模型通过 ChatGPT 消息撰写器中的 'Reason' 选项向免费用户提供。
- Enterprise: 访问计划于 二月 提供。
- API: 正在通过 Chat Completions、Assistants 和 Batch APIs 向使用等级 3-5 的开发者逐步推出。
- Rate Limits: Plus 和 Team 用户的速率限制已从每天 50 条消息(o1-mini)提高三倍至每天 150 条消息(o3-mini)。
安全与对齐
OpenAI 使用了 "deliberative alignment" 来训练 o3-mini,这是一种在生成响应之前让模型推理人类编写的安全规范的过程。这种方法使 o3-mini 在具有挑战性的安全和越狱评估中显著超越了 GPT-4o。该模型经过了外部红队测试和安全评估,这些评估与用于 OpenAI o1 的准备就绪方法保持一致。
Sources
- OriginalOpenAI o3-mini