OpenAI o3 和 o4-mini 视觉推理发布
OpenAI o3 和 o4-mini 引入了模型“用图像思考”的能力,这意味着它们现在可以在内部思考链中执行图像处理——如裁剪、放大和旋转——以解决复杂的视觉问题。这标志着从仅仅“看”图像的模型向能够使用多模态代理方法主动推理图像的模型的转变。
思考链中的原生图像处理
OpenAI o3 和 o4-mini 通过原生集成视觉工具,扩展了 o 系列的长篇内部推理能力。与之前的多模态模型不同,这些模型不依赖于单独的专用图像处理模型;相反,它们可以在推理过程中自动对用户上传的图像应用以下技术:
- Zooming and Cropping: 聚焦图像的特定区域以提取更细节或读取小文字。
- Rotation and Flipping: 校正图像的方向(例如,将倒置文字旋转)以使其可读。
- Enhancement: 应用简单的图像处理技术以提升清晰度。
该能力使模型能够处理不完美的照片,例如位置不佳、文字倒置或单帧中包含多个问题的图像,模型会在得出最终答案之前迭代地细化对数据的视图。
多模态代理能力
通过将视觉推理与其他工具相结合,o3 和 o4-mini 提供了多模态代理体验。模型可以将内部图像处理与外部工具(如网络搜索和 Python 数据分析)结合,以解决高复杂度任务。
这些能力的示例包括:
- Document Analysis: 通过旋转并放大文本,读取笔记本中的手写内容。
- Complex Problem Solving: 使用 Python 分析 alpha 通道和像素值,以绘制有效路径,从而解决迷宫。
- Technical Troubleshooting: 对构建错误的截图进行根本原因分析。
- Educational Support: 为通过照片上传的经济学题集提供逐步解释。
基准性能与扩展
“用图像思考”的引入为测试时计算扩展提供了新的维度,融合了视觉和文本推理。在高“推理努力”设置下进行评估时,o3 和 o4-mini 在所有测试任务中显著超越了之前的多模态模型。
关键性能里程碑包括:
- State-of-the-Art (SOTA) Results: 模型在 STEM 问答(MMMU、MathVista)、图表阅读与推理(CharXiv)、感知原语(VLMs are Blind)以及视觉搜索(V*)方面达到了 SOTA 表现。
- Visual Search Mastery: 在 V* 基准上,视觉推理方法实现了 95.7% 的准确率,基本解决了该基准。
当前局限性
尽管取得了进展,OpenAI 仍指出当前视觉推理实现的三大主要局限:
- Inefficient Reasoning Chains: 模型可能执行冗余的工具调用或不必要的图像处理,导致思考链过于冗长。
- Perception Errors: 基本的感知错误仍可能出现;模型可能正确使用工具放大,但仍误解得到的视觉数据。
- Reliability Issues: 模型在对同一问题的多次尝试中可能采用不同的视觉推理路径,导致结果不一致。
OpenAI 正在对这些模型进行优化,使其在多模态推理过程中更加简洁和可靠。
Sources
- OriginalThinking with images