TITLE: AI Drawing Arena: GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash、およびGrok 4.5の比較

AI Drawing Arena: Comparing GPT-5.6 Sol, Claude Fable 5, Gemini 3.6 Flash, and Grok 4.5

エグゼクティブサマリー

GPT-5.6 Solは、描画アリーナテストにおいて最も能力が高く効率的なモデルとして浮上し、最低のコストとトークン使用量で最高品質の芸術的出力を生み出しました。一方、Gemini 3.6 Flashはターゲット再現において最高の客観的構造類似度(SSIM)スコアを達成しましたが、Claude Fable 5は競合他社の約20倍のコストがかかることが判明し、品質に比例した向上は見られませんでした。Grok 4.5は性能が低く、しばしば使用可能な画像を生成できませんでした。

描画アリーナ手法

研究者は、白い空のキャンバス上で標準化された色鉛筆ツールセットを使用して、4つのビジョンモデル(GPT-5.6 SolClaude Fable 5Grok 4.5、およびGemini 3.6 Flash)をテストしました。最終的なピクセルグリッドを生成する画像生成モデルとは異なり、これらのモデル(GPT-5.6 SolClaude Fable 5Grok 4.5、およびGemini 3.6 Flash)をテストしました。最終的なピクセルグリッドを生成する画像生成モデルとは異なり、これらのモデルは特定のツール呼び出しを使用して画像を反復的に構築する必要がありました:

  • 描画ツール: draw (バッチマーク)、set_colorset_brush、および set_pressure(不透明度)。
  • 変更ツール: smudge (領域のぼかし/柔らかめ)、erase、および clear_canvas
  • 観察ツール: view_target (参照画像)および view_canvas(現在の状態)。
  • 計画: 内部推論のためのplan no-op スクラッチパッド。

モデルには、モナリザとゴッホの『星月夜』の2つのターゲット再現および5つのオープンエンドテストプロンプトが課されました。パフォーマンスは、ターゲット実行における構造的類似度指数(SSIM)および平均二乗誤差(RMSE)で測定され、それに加えて定性的評価とコスト分析が行われました。

パフォーマンス分析: 品質 vs. 効率

GPT-5.6 Sol: 効率のリーダー

GPT-5.6 Solは、全体的な品質とリソース効率においてトップパフォーマーでした。特に、set_* ツールを完全にバイパスし、代わりに各 draw 呼び出し内でインラインに色、ブラシ、および圧力を定義しました。この合理化されたアプローチにより、トークン使用量とコストが大幅に削減されました(7枚の描画で $7.74)。

Claude Fable 5: 高コスト、減少するリターン

Claude Fable 5は、コストと出力の間に顕著な格差を示しました。7枚の描画に推定コスト $160.58 がかかり、これは GPT-5.6 Sol の約20倍です。この投資とツール呼び出しの増加(特に smudgeview_canvas)にもかかわらず、品質において Sol を上回ることはありませんでした。

Gemini 3.6 Flash: 高い構造的精度

Gemini 3.6 Flashは最高の客観的SSIMスコアを達成し、モナリザでピーク0.449を記録しました。ただし、研究者たちはそれがターゲットに構造的に近いものの、人間観察者にとって必ずしも最も美的に見えるわけではないと指摘しました。また、view_canvas ツールの最も頻繁な利用者でもあり、1枚の描画あたり平均23回の自己レビューを行っていました。

Grok 4.5: 重大な能力ギャップ

Grok 4.5はこのタスクに苦戦し、しばしば使用不能または「超現実的」な結果を生み出しました。そのツール呼び出しパターンは非常に非効率的で、呼び出しの65%が set_colorset_brush、および set_pressure に費やされ、使用可能な視覚出力を達成することなく、1枚の描画あたり平均99ステップとなりました。

反復的改善における主要な発見

最も重要な発見の一つは、モデルは早期に平坦化し、しばしば時間とともに自分の作業を劣化させる傾向があるということです。

8つのターゲット再現実行すべてにおいて、最終的な描画のスコアは、モデルが中盤で到達した最高バージョンよりも低かった。たとえば、Gemini 3.6 FlashはモナリザでピークSSIM 0.449に到達したが、最終的に0.337で終わった。これは、モデルに「元に戻す」メカニズムがなく、ピーク性能を過ぎても編集を続けることを示唆しており、これは一部のモデルがコーディングタスクにおいて、壊れた要素を削除する代わりに以前のエラーを修正するためにより多くのコードを追加する動作と類似している。

比較メトリクステーブル

モデル 平均ステップ数 平均時間 総トークン数 総コスト 最終 SSIM (モナリザ) ピーク SSIM (モナリザ)
GPT-5.6 Sol 29 6.2 min 3.4M $7.74 0.325 0.352
Claude Fable 5 54 12.5 min 14.6M $160.58 0.286 0.289
Grok 4.5 99 4.8 min 34.0M 0.151 0.152
Gemini 3.6 Flash 73 6.9 min 27.7M $12.87 0.337 0.449

コミュニティの洞察と批判

技術観察者間の議論では、テストの性質に関するいくつかのポイントが指摘されました:

  • 芸術的成熟度: 一部の観察者は、出力が「子供っぽい」と指摘し、光、形状、屈折の理解ではなく、オブジェクトの概念的理解(例えば、「青 = ガラス」)を反映していると述べました。
  • 推論の革新: GPT-5.6 Solの効率は、OpenAIの推論とトークン管理における静かな革新の証拠として挙げられました。
  • メトリクの妥当性: 批判者は、SSIM/RMSEがピクセルベースのメトリクであり、人間の芸術的判断と必ずしも一致しないと主張し、視覚的品質との整合性を高めるためにDINOv2を用いたコサイン類似度の使用を提案しました。

Sources