AI 繪畫競技場:GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 與 Grok 4.5 之比較
AI 繪畫競技場:GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 與 Grok 4.5 之比較
執行摘要
在繪畫競技場測試中,GPT-5.6 Sol 脫穎而出,成為能力最強且最高效的模型,以最低的成本和 Token 使用量產出了最高品質的藝術輸出。雖然 Gemini 3.6 Flash 在目標重現的客觀結構相似度 (SSIM) 分數上獲得最高,但 Claude Fable 5 被發現成本極高——其成本約為競爭對手的 20 倍——卻未能提供成比例的品質提升。Grok 4.5 表現不佳,經常無法產出可用的圖像。
繪畫競技場方法論
研究人員使用一套標準化的彩色鉛筆工具集,在空白畫布上測試了四個視覺模型:GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash。與產生最終像素網格的圖像生成模型不同,這些模型必須透過特定的工具調用來迭代構建圖像:
- 繪畫工具:
draw(批次標記)、set_color、set_brush以及set_pressure(不透明度)。 - 修改工具:
smudge(混合/軟化區域)、erase以及clear_canvas。 - 觀察工具:
view_target(參考圖像) 以及view_canvas(當前狀態)。 - 規劃:一個用於內部推理的
planno-op 暫存區。
模型被要求完成兩項目標重現任務(《蒙娜麗莎》與梵谷的《星夜》)以及五個開放式文本提示。性能衡量標準包括目標執行過程中的結構相似性指數 (SSIM) 和均方根誤差 (RMSE),以及定性評估和成本分析。
性能分析:品質 vs. 效率
GPT-5.6 Sol:效率領航者
GPT-5.6 Sol 在整體品質和資源效率方面表現最佳。它顯著地完全跳過了 set_* 工具,轉而將顏色、筆刷和壓力直接定義在每個 draw 調用中。這種精簡的方法導致 Token 使用量和成本大幅降低(七幅畫僅花費 7.74 美元)。
Claude Fable 5:高成本,邊際效益遞減
Claude Fable 5 展現了成本與輸出之間的巨大差距。完成七幅畫的估計成本為 160.58 美元——約為 GPT-5.6 Sol 成本的 20 倍。儘管投入了如此高的成本並進行了大量的工具調用(特別是 smudge 和 view_canvas),其品質卻未能超越 Sol。
Gemini 3.6 Flash:高結構準確度
Gemini 3.6 Flash 達到了最高的客觀 SSIM 分數,在《蒙娜麗莎》上達到 0.449 的峰值。然而,研究人員指出,雖然它在結構上接近目標,但對人類觀察者來說,視覺上未必是最美觀的。它也是最頻繁使用 view_canvas 工具的模型,平均每幅畫進行 23 次自我檢查。
Grok 4.5:顯著的能力差距
Grok 4.5 在任務中表現掙扎,經常產生無法使用或「超現實」的結果。它採用了極低效率的工具調用模式,65% 的調用都用於 set_color、set_brush 和 set_pressure,導致每幅畫平均需要 99 個步驟卻無法達成可用的視覺輸出。
關於迭代改進的關鍵發現
其中一個最關鍵的發現是:模型往往會過早進入平台期,並隨著時間推移而惡化自己的作品。
在所有八次目標重現運行中,最終繪畫的得分都低於模型在運行中達到的最佳版本。例如,Gemini 3.6 Flash 在《蒙娜麗莎》上達到了 0.449 的 SSIM 峰值,但最終結束時僅為 0.337。這表明模型缺乏「復原」機制,並會在超越巔峰表現後繼續編輯,這種行為也反映在某些模型處理編碼任務的方式上——即透過增加更多代碼來修復先前的錯誤,而不是移除錯誤的元素。
比較指標表
| 模型 | 平均步驟 | 平均時間 | 總 Token | 總成本 | 最終 SSIM (蒙娜麗莎) | 峰值 SSIM (蒙娜麗莎) |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 29 | 6.2 min | 3.4M | $7.74 | 0.325 | 0.352 |
| Claude Fable 5 | 54 | 12.5 min | 14.6M | $160.58 | 0.286 | 0.289 |
| Grok 4.5 | 99 | 4.8 min | 34.0M | $0.151 | 0.152 | |
| Gemini 3.6 Flash | 73 | 6.9 min | 27.7M | $12.87 | 0.337 | 0.449 |
社群見解與評論
技術觀察人士的討論強調了關於測試性質的幾個觀點:
- 藝術成熟度:部分觀察者指出輸出看起來很「幼稚」,反映的是對物體的概念性理解(例如「藍色 = 玻璃」),而非對光影、形式和折射的理解。
- 推理創新:GPT-5.6 Sol 的效率被視為 OpenAI 在推理和 Token 管理方面進行隱形創新的證據。
- 指標有效性:批評者認為 SSIM/RMSE 是基於像素的指標,可能與人類的藝術判斷不一致,並建議使用透過 DINOv2 的餘弦相似度 (cosine similarity) 以更好地與視覺品質對齊。