OpenAI o3 與 o4-mini 視覺推理發布
OpenAI o3 與 o4-mini 引入了模型「以圖像思考」的能力,意味著它們現在可以在內部思考鏈中執行圖像操作——例如裁剪、縮放與旋轉——以解決複雜的視覺問題。這標誌著從僅能觀看圖像的模型,轉變為能以多模態代理方式積極推理圖像的模型。
內部思考鏈中的原生圖像操作
OpenAI o3 與 o4-mini 透過原生整合視覺工具,擴展了 o 系列的長篇內部推理能力。與先前的多模態模型不同,這些模型不依賴於獨立的專門圖像處理模型;相反地,它們能在推理過程中自動對使用者上傳的圖像套用以下技術:
- 縮放與裁剪: 聚焦於圖像的特定區域,以提取更細緻的細節或閱讀小字。
- 旋轉與翻轉: 校正圖像的方向(例如,將倒置文字旋轉)以使其可讀。
- 增強: 套用簡單的圖像處理技術以提升清晰度。
此功能使模型能處理不完美的照片,例如構圖不佳、文字倒置或單一畫面中包含多個問題的情況,透過迭代式地精煉對資料的觀察,最終得出答案。
多模態代理能力
透過將視覺推理與其他工具結合,o3 與 o4-mini 提供了多模態代理體驗。模型能將內部圖像操作與外部工具(如網路搜尋與 Python 資料分析)結合,以解決高複雜度任務。
此類能力的範例包括:
- 文件分析: 透過旋轉與縮放文字,閱讀筆記本上的手寫內容。
- 複雜問題解決: 使用 Python 分析 alpha 通道與像素值,繪製有效路徑以解開迷宮。
- 技術故障排除: 對建置錯誤的螢幕截圖進行根本原因分析。
- 教育支援: 為以照片上傳的經濟學題目集提供逐步說明。
基準表現與擴展性
「以圖像思考」的引入為測試時的計算擴展創造了新維度,結合視覺與文字推理。於高「推理努力」設定下評估時,o3 與 o4-mini 在所有測試任務中顯著超越先前的多模態模型。
關鍵績效里程碑包括:
- 最先進(SOTA)成果: 這些模型在 STEM 問答(MMMU、MathVista)、圖表閱讀與推理(CharXiv)、感知基礎(VLMs are Blind)以及視覺搜尋(V*)方面達到最先進表現。
- 視覺搜尋精通: 在 V* 基準測試中,視覺推理方法取得 95.7% 的正確率,基本上解決了該基準。
目前的限制
儘管取得了進展,OpenAI 仍指出目前視覺推理實作的三大主要限制:
- 推理鏈低效: 模型可能執行冗餘的工具呼叫或不必要的圖像操作,導致思考鏈過長。
- 感知錯誤: 基本的感知失誤仍可能發生;模型或許正確使用工具進行縮放,卻仍誤判產生的視覺資料。
- 可靠性問題: 模型在對同一問題的多次嘗試中可能採用不同的視覺推理路徑,導致結果不一致。
OpenAI 正在持續優化這些模型,使其在多模態推理過程中更加簡潔且可靠。
Sources
- OriginalThinking with images