OpenAI o3 和 o4-mini 发布说明 / 有何新特性
OpenAI 已发布 o3 和 o4-mini,它们是 o 系列中最新的模型,专为扩展推理而设计。这些模型通过将最先进的推理能力与自主使用和组合工具的能力相结合——包括网络搜索、Python 数据分析和图像生成——在通常不到一分钟的时间内解决多方面的问题,代表了智能和实用性的重大进步。
OpenAI o3 的前沿推理
OpenAI o3 是迄今为止发布的最强推理模型,在包括 Codeforces、MMMU 和 SWE-bench(在固定的 477 项已验证任务子集上评估,未使用自定义模型特定脚手架)等基准上实现了新的 state-of-the-art (SOTA) 表现。
关键性能提升包括:
- Error Reduction(错误降低): 在外部专家评估中,o3 在困难的真实任务上比 OpenAI o1 少出现 20% 的重大错误,尤其在创意构思、商业/咨询和编程方面。
- Analytical Rigor(分析严谨): 早期测试者注意到 o3 能够在工程、数学和生物学情境中生成并批判性评估新颖假设。
- Visual Perception(视觉感知): o3 在分析图形、图表和图像方面表现强劲。
OpenAI o4-mini 的高效推理
OpenAI o4-mini 是一款体积更小、经过优化的模型,专为高容量、高吞吐量的推理任务设计。它在数据科学和非 STEM 领域的表现优于其前身 o3-mini。
显著基准包括:
- AIME Performance(AIME 表现): o4-mini 是在 AIME 2024 和 2025 上表现最佳的基准模型。在提供 Python 解释器的情况下,它在 AIME 2025 上实现了 99.5% 的 pass@1(100% 的 consensus@8)。
- Efficiency(效率): 由于体积较小,o4-mini 支持的使用上限远高于 o3,同时在编码、数学和视觉任务上保持强劲表现。
多模态推理与视觉融合
首次,o 系列模型将图像直接整合进思考链,使其能够“以图像思考”,而不仅仅是感知图像。这让模型能够通过融合视觉与文本推理来解决复杂问题。
能力包括:
- Robust Interpretation(稳健解释): 这些模型能够解释模糊、低质量或倒置的图像,例如手绘草图、教材图表或白板照片。
- Active Manipulation(主动操作): 通过使用工具,模型可以在推理过程中对图像进行放大、旋转或变换,以更好地分析输入。
自主工具使用与工作流自动化
OpenAI o3 和 o4-mini 通过强化学习训练,学习何时以及如何使用工具以实现期望结果。它们可完全访问 ChatGPT 工具并通过 API 函数调用使用自定义工具。
这种策略性方法支持多步骤工作流,例如:
- Iterative Research(迭代研究): 多次进行网络搜索、分析结果,并根据发现的信息调整搜索查询。
- Complex Synthesis(复杂综合): 将网络搜索用于公共数据、Python 用于预测、图像生成用于可视化,链式组合以回答单一的复杂查询。
强化学习的规模化 (RL)
OpenAI 观察到,大规模强化学习遵循“算力越多 = 性能越好”的趋势,这与 GPT 系列的预训练类似。通过将训练算力和推理时的算力提升一个数量级,OpenAI 验证了随着模型被允许更长时间“思考”,性能会持续提升。
在与 OpenAI o1 相同的延迟和成本下,o3 提供了更高的性能,并且通过延长推理时间还能获得进一步的提升。
安全性与风险缓解
OpenAI 为这些模型重新构建了安全训练数据,新增了针对越狱、恶意软件生成和生物威胁(biorisk)的拒绝提示。
安全措施包括:
- Reasoning LLM Monitor(推理 LLM 监控): 该监控基于人工编写的安全规范进行训练,能够标记约 99% 的 biorisk 人类红队演练对话。
- Preparedness Framework(准备框架): 两个模型在网络安全、AI 自我改进以及生物/化学风险方面均进行了评估。o3 和 o4-mini 在这三类风险中均低于 “High” 阈值。
Codex CLI 与开发者访问
OpenAI 推出了 Codex CLI,这是一款开源的轻量级编码代理,可在终端运行。它允许用户向 o3 和 o4-mini 传递截图或草图,同时为模型提供对本地代码的访问。
访问详情:
- ChatGPT: Plus、Pro 和 Team 用户可使用 o3、o4-mini 和 o4-mini-high。Enterprise 和 Edu 用户将在一周后获得访问权限。免费用户可通过 “Think” 选项使用 o4-mini。
- API: 两个模型均可通过 Chat Completions 和 Responses API 使用。Responses API 支持推理摘要以及在函数调用周围保留推理 token。
- o3-pro: 为实现更长思考时间和更高可靠性而设计的 o3 版本,可供 ChatGPT 和 API 的 Pro 用户使用(截至 2025 年 6 月 10 日)。