OpenAI GPT-5.6 Sol の視覚能力とベンチマーク

GPT-5.6 Sol が OpenAI の視覚的理解を前進させる

OpenAI の GPT-5.6 ラインナップ(Sol、Terra、Luna で構成)は、特に物体検出とカウントにおいて、視覚能力の大きな飛躍を達成しました。GPT-5.6 Sol は OpenAI がこれまでにリリースした中で最も有能な視覚モデルですが、コスト、レイテンシ、および生の検出精度という点では Gemini 3.5 Flash との激しい競争に直面しています。

物体検出とカウントにおける大幅な向上

GPT-5.6 Sol は、物体検出を大きな弱点から実用的な能力へと変貌させました。Roboflow のベンチマークでは、Sol は 46.2 mAP@50 スコアを達成し、GPT-5.5 の 13.8 から大幅に増加しました。Terra と Luna は、それぞれ 44.7 と 43.3 でこれに続きました。

主要な検出の強み

  • Document Layout: Sol は、タイトル、段落、表、画像、署名を識別することに長けており、ドキュメントのワークフローを تسهل (facilitate) します。
  • Dense Scenes: このモデルは、多くの類似した、密集した物体(例:錠剤や卵)を含むシーンを、以前のバージョンよりも効果的に処理します。
  • Coordinate Prompting: パフォーマンスはプロンプトの形式に非常に敏感です。GPT-5.6 モデルは、画像のピクセルにおける絶対的な XYXY 座標をプロンプトで指定した場合に最高のパフォーマンスを発揮します。誤った形式を使用すると、パフォーマンスが約 15 mAP ポイント低下する可能性があります。

カウントの精度

カウントのパフォーマンスは、ラインナップ全体で向上しました。Sol は、GPT-5.5 の 64.9% から 73.0% の精度に達しました。このモデルは、重なり合った物体をカウントする能力や、特定のゾーンにカウントルールを適用する能力(例:スコアリングゾーン内のみの弾痕をカウントする)を示しました。

OCR とデータ抽出のパフォーマンス

OCR のパフォーマンスは、GPT-5.5 と比較して比較的安定しています。Sol は 90.7% の平均類似度スコアを達成しましたが、GPT-5.5 の 91.2% にはわずかに及びませんでした。テキスト抽出では、Sol は 82.5% を記録し、GPT-5.5 は 87.6% を記録しました。

生のスコアはわずかに低下したものの、Sol は複雑なシナリオにおいて高い有用性を示しました:

  • Handwritten Text: 手書きのテキストを完全に書き起こし、手書きのメモから特定の詳細な日付を抽出することに成功しました。
  • Embedded Text: 曲面や汚れた表面にあるタイヤのサイズ表記を読み取り、スポーツ中継からのライブスコアを抽出することに成功しました。
  • Failure Points: 反射の影響を受ける小さな、垂直な、低コントラストのテキスト(例:ブリスターパック上の有効期限)は、依然として課題として残ります。

運用上のトレードオフ:コスト、レイテンシ、および安定性

視覚能力の向上は、トークン使用量の増加と運用コストの上昇を伴います。

Model Avg. Time per Image Avg. Cost per Image
GPT-5.6 Sol ~10 seconds ~$0.025
GPT-5.6 Terra ~6 seconds ~$0.01
GPT-5.6 Luna ~5 seconds <$0.005
Gemini 3.5 Flash N/A ~$0.008

安定性の問題

OpenAI は、Sol が 2,000 x 2,000 ピクセル以上の画像に対して不安定になることを認めています。より高度な推論(reasoning effort)を行わせることで安定性を向上させることができますが、コストとレイテンシが増大します。推奨される回避策は、API 送信前に画像をリサイズまたはクロップすることです。

コミュニティの洞察と反論

ベンチマークデータは進歩を示していますが、コミュニティの議論では、これらのモデルの実用的な適用について、いくつかの重要な視点が見て取れます。

競争的なポジショニング

いくつかのユーザーは、Gemini 3.5 Flash が検出とカウントにおいて Sol を上回ることが多く、かつ大幅に安価であることに言及しています。あるユーザーは次のように指摘しています:

GPT 5.6 Sol は、Fable が勝者となった唯一の例外(OCR)を除いて、すべてのベンチマークで Gemini 3.5 Flash に負けています。Gemini 3.5 Flash は GPT 5.6 Sol を上回るだけでなく、その 1/3 のコストでそれを実現しています。

特化型ユースケース

ユーザーは、一般的なベンチマークが価値を捉えきれないニッチな領域で成功を報告しています:

  • UI/UX Analysis: ユーザーの一人は、非標準的な UI ブロックを識別し、ページを構成要素として再構築する能力において、Sol が Claude よりも優れていることを見出したしました。
  • Video Captioning: あるユーザーは、Sol が現在、最高のビデオキャプションモデルであると主張しています。特に、複雑なサブ秒単位の動きを正確にキャプション・キャプションすることに長けてています。
  • Specialized Transcription: あるユーザーは、Sol が楽譜を書き起こすことに成功したと報告しました。これは、通常、ほとんどの視覚モデルが躓くタスクです。

技術的な懐疑論

一部の開発者は、展示されたタスク(例:錠剤のカウント)の多くは、従来のコンピュータビジョン・ツールによってより良く処理できると主張しています。あるユーザーが次のように述べています:

皮肉なことに、「最高の視覚モデル」を示すために選ばれた錠剤のカウントの例は、25 年前に作成された技術である OpenCV のテンプレートマッチングで簡単に解決できるものです。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch