OpenAI o3 和 o4-mini 视觉推理发布

OpenAI o3 和 o4-mini 引入了模型“用图像思考”的能力,这意味着它们现在可以在内部思考链中执行图像处理——如裁剪、放大和旋转——以解决复杂的视觉问题。这标志着从仅仅“看”图像的模型向能够使用多模态代理方法主动推理图像的模型的转变。

思考链中的原生图像处理

OpenAI o3 和 o4-mini 通过原生集成视觉工具,扩展了 o 系列的长篇内部推理能力。与之前的多模态模型不同,这些模型不依赖于单独的专用图像处理模型;相反,它们可以在推理过程中自动对用户上传的图像应用以下技术:

  • Zooming and Cropping: 聚焦图像的特定区域以提取更细节或读取小文字。
  • Rotation and Flipping: 校正图像的方向(例如,将倒置文字旋转)以使其可读。
  • Enhancement: 应用简单的图像处理技术以提升清晰度。

该能力使模型能够处理不完美的照片,例如位置不佳、文字倒置或单帧中包含多个问题的图像,模型会在得出最终答案之前迭代地细化对数据的视图。

多模态代理能力

通过将视觉推理与其他工具相结合,o3 和 o4-mini 提供了多模态代理体验。模型可以将内部图像处理与外部工具(如网络搜索和 Python 数据分析)结合,以解决高复杂度任务。

这些能力的示例包括:

  • Document Analysis: 通过旋转并放大文本,读取笔记本中的手写内容。
  • Complex Problem Solving: 使用 Python 分析 alpha 通道和像素值,以绘制有效路径,从而解决迷宫。
  • Technical Troubleshooting: 对构建错误的截图进行根本原因分析。
  • Educational Support: 为通过照片上传的经济学题集提供逐步解释。

基准性能与扩展

“用图像思考”的引入为测试时计算扩展提供了新的维度,融合了视觉和文本推理。在高“推理努力”设置下进行评估时,o3 和 o4-mini 在所有测试任务中显著超越了之前的多模态模型。

关键性能里程碑包括:

  • State-of-the-Art (SOTA) Results: 模型在 STEM 问答(MMMU、MathVista)、图表阅读与推理(CharXiv)、感知原语(VLMs are Blind)以及视觉搜索(V*)方面达到了 SOTA 表现。
  • Visual Search Mastery: 在 V* 基准上,视觉推理方法实现了 95.7% 的准确率,基本解决了该基准。

当前局限性

尽管取得了进展,OpenAI 仍指出当前视觉推理实现的三大主要局限:

  1. Inefficient Reasoning Chains: 模型可能执行冗余的工具调用或不必要的图像处理,导致思考链过于冗长。
  2. Perception Errors: 基本的感知错误仍可能出现;模型可能正确使用工具放大,但仍误解得到的视觉数据。
  3. Reliability Issues: 模型在对同一问题的多次尝试中可能采用不同的视觉推理路径,导致结果不一致。

OpenAI 正在对这些模型进行优化,使其在多模态推理过程中更加简洁和可靠。

Sources