AI 繪畫競技場:GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 與 Grok 4.5 之比較

AI 繪畫競技場:GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 與 Grok 4.5 之比較

執行摘要

在繪畫競技場測試中,GPT-5.6 Sol 脫穎而出,成為能力最強且最高效的模型,以最低的成本和 Token 使用量產出了最高品質的藝術輸出。雖然 Gemini 3.6 Flash 在目標重現的客觀結構相似度 (SSIM) 分數上獲得最高,但 Claude Fable 5 被發現成本極高——其成本約為競爭對手的 20 倍——卻未能提供成比例的品質提升。Grok 4.5 表現不佳,經常無法產出可用的圖像。

繪畫競技場方法論

研究人員使用一套標準化的彩色鉛筆工具集,在空白畫布上測試了四個視覺模型:GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash。與產生最終像素網格的圖像生成模型不同,這些模型必須透過特定的工具調用來迭代構建圖像:

  • 繪畫工具draw (批次標記)、set_colorset_brush 以及 set_pressure (不透明度)。
  • 修改工具smudge (混合/軟化區域)、erase 以及 clear_canvas
  • 觀察工具view_target (參考圖像) 以及 view_canvas (當前狀態)。
  • 規劃:一個用於內部推理的 plan no-op 暫存區。

模型被要求完成兩項目標重現任務(《蒙娜麗莎》與梵谷的《星夜》)以及五個開放式文本提示。性能衡量標準包括目標執行過程中的結構相似性指數 (SSIM) 和均方根誤差 (RMSE),以及定性評估和成本分析。

性能分析:品質 vs. 效率

GPT-5.6 Sol:效率領航者

GPT-5.6 Sol 在整體品質和資源效率方面表現最佳。它顯著地完全跳過了 set_* 工具,轉而將顏色、筆刷和壓力直接定義在每個 draw 調用中。這種精簡的方法導致 Token 使用量和成本大幅降低(七幅畫僅花費 7.74 美元)。

Claude Fable 5:高成本,邊際效益遞減

Claude Fable 5 展現了成本與輸出之間的巨大差距。完成七幅畫的估計成本為 160.58 美元——約為 GPT-5.6 Sol 成本的 20 倍。儘管投入了如此高的成本並進行了大量的工具調用(特別是 smudgeview_canvas),其品質卻未能超越 Sol。

Gemini 3.6 Flash:高結構準確度

Gemini 3.6 Flash 達到了最高的客觀 SSIM 分數,在《蒙娜麗莎》上達到 0.449 的峰值。然而,研究人員指出,雖然它在結構上接近目標,但對人類觀察者來說,視覺上未必是最美觀的。它也是最頻繁使用 view_canvas 工具的模型,平均每幅畫進行 23 次自我檢查。

Grok 4.5:顯著的能力差距

Grok 4.5 在任務中表現掙扎,經常產生無法使用或「超現實」的結果。它採用了極低效率的工具調用模式,65% 的調用都用於 set_colorset_brushset_pressure,導致每幅畫平均需要 99 個步驟卻無法達成可用的視覺輸出。

關於迭代改進的關鍵發現

其中一個最關鍵的發現是:模型往往會過早進入平台期,並隨著時間推移而惡化自己的作品。

在所有八次目標重現運行中,最終繪畫的得分都低於模型在運行中達到的最佳版本。例如,Gemini 3.6 Flash 在《蒙娜麗莎》上達到了 0.449 的 SSIM 峰值,但最終結束時僅為 0.337。這表明模型缺乏「復原」機制,並會在超越巔峰表現後繼續編輯,這種行為也反映在某些模型處理編碼任務的方式上——即透過增加更多代碼來修復先前的錯誤,而不是移除錯誤的元素。

比較指標表

模型 平均步驟 平均時間 總 Token 總成本 最終 SSIM (蒙娜麗莎) 峰值 SSIM (蒙娜麗莎)
GPT-5.6 Sol 29 6.2 min 3.4M $7.74 0.325 0.352
Claude Fable 5 54 12.5 min 14.6M $160.58 0.286 0.289
Grok 4.5 99 4.8 min 34.0M $0.151 0.152
Gemini 3.6 Flash 73 6.9 min 27.7M $12.87 0.337 0.449

社群見解與評論

技術觀察人士的討論強調了關於測試性質的幾個觀點:

  • 藝術成熟度:部分觀察者指出輸出看起來很「幼稚」,反映的是對物體的概念性理解(例如「藍色 = 玻璃」),而非對光影、形式和折射的理解。
  • 推理創新:GPT-5.6 Sol 的效率被視為 OpenAI 在推理和 Token 管理方面進行隱形創新的證據。
  • 指標有效性:批評者認為 SSIM/RMSE 是基於像素的指標,可能與人類的藝術判斷不一致,並建議使用透過 DINOv2 的餘弦相似度 (cosine similarity) 以更好地與視覺品質對齊。

Sources