OpenAI GPT-5.6 Sol 視覺能力與基準測試

GPT-5.6 Sol 推動 OpenAI 的視覺理解進步

OpenAI 的 GPT-5.6 系列——包含 Sol、Terra 和 Luna——標誌著視覺能力的重大躍進,特別是在物件偵測與計數方面。雖然 GPT-5.6 Sol 是 OpenAI 目前發布最具能力的視覺模型,但在成本、延遲和原始偵測準確性方面,仍面臨 Gemini 3.5 Flash 的強勁競爭。

物件偵測與計數的顯著進步

GPT-5.6 Sol 將物件偵測從一個重大弱點轉變為實用功能。在 Roboflow 的基準測試中,Sol 取得 46.2 mAP@50 的分數,遠高於 GPT-5.5 的 13.8。Terra 和 Luna 分別取得 44.7 和 43.3 的成績,緊追其後。

關鍵偵測優勢

  • 文件版面: Sol 在識別標題、段落、表格、圖片和簽名方面表現出色,有助於文件工作流程的自動化。
  • 密集場景: 該模型能更有效地處理包含許多相似且緊密排列物件的場景(例如藥丸或雞蛋)。
  • 座標提示: 性能高度依賴提示格式。GPT-5.6 模型在要求以圖像像素為單位的絕對 XYXY 座標時表現最佳;使用錯誤格式可能導致性能下降約 15 mAP 點。

計數準確性

整個系列的計數性能均有提升。Sol 的準確率達到 73.0%,高於 GPT-5.5 的 64.9%。該模型展現出計數重疊物件的能力,並能針對特定區域套用計數規則(例如僅計數得分區域內的子彈孔)。

OCR 與資料萃取表現

與 GPT-5.5 相比,OCR 表現相對穩定。Sol 取得 90.7% 的平均相似度分數,略低於 GPT-5.5 的 91.2%。在文字萃取方面,Sol 得分 82.5%,而 GPT-5.5 為 87.6%。

儘管原始分數略有下降,Sol 在複雜情境中展現出高度實用性:

  • 手寫文字: 成功產出完整轉錄,並從手寫筆記中萃取特定日期。
  • 嵌入式文字: 能讀取彎曲、髒汙表面上的輪胎尺寸序列,並從體育轉播中提取即時比分。
  • 失敗點: 小型、垂直、低對比度且受反射影響的文字(例如鋁箔包上的有效期限)仍是挑戰。

運作上的權衡:成本、延遲與穩定性

視覺能力的提升伴隨著更高的 token 使用量與更高的營運成本。

模型 每張圖像平均耗時 每張圖像平均成本
GPT-5.6 Sol ~10 秒 ~$0.025
GPT-5.6 Terra ~6 秒 ~$0.01
GPT-5.6 Luna ~5 秒 <$0.005
Gemini 3.5 Flash N/A ~$0.008

穩定性問題

OpenAI 已確認,Sol 在 2,000 x 2,000 像素或更大的圖片上會變得較不穩定。雖然增加推理努力可提升穩定性,但會導致成本與延遲上升。建議的解決方案是在提交 API 前先調整或裁切圖片。

社群見解與反駁觀點

儘管基準數據顯示進步,社群討論也凸顯了這些模型在實際應用中的幾個關鍵觀點:

競爭定位

多位使用者指出,Gemini 3.5 Flash 在偵測與計數方面經常超越 Sol,且成本顯著更低。一位使用者指出:

GPT 5.6 Sol 在所有基準測試中均被 Gemini 3.5 Flash 壓制,僅有一項例外(OCR)由 Fable 勝出。Gemini 3.5 Flash 不僅超越 GPT 5.6 Sol,且成本僅為其 1/3。

專用應用場景

使用者報告在一般基準難以體現價值的專門領域取得成功:

  • UI/UX 分析: 有使用者發現 Sol 優於 Claude,能更有效識別非標準的 UI 區塊,並將頁面重構為可組合的單元。
  • 影片字幕生成: 有使用者聲稱 Sol 目前是最佳的影片字幕模型,特別是在準確標註複雜的次秒級動作方面。
  • 專用轉錄: 有使用者報告 Sol 成功轉錄樂譜,這類任務通常會讓大多數視覺模型陷入困境。

技術懷疑論

部分開發者認為,許多展示的任務(如藥丸計數)其實更適合由傳統電腦視覺工具處理。正如一位使用者所言:

諷刺的是,用來展示「最佳視覺模型」的藥丸計數範例,其實可輕易透過 OpenCV 模板匹配解決,而這項技術已存在 25 年。

Sources

相關