TITLE: AI 绘图竞技场:比较 GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 和 Grok 4.5

AI Drawing Arena: Comparing GPT-5.6 Sol, Claude Fable 5, Gemini 3.6 Flash, and Grok 4.5

Executive Summary

GPT-5.6 Sol 在绘图竞技场测试中表现为最强且最高效的模型,以最低的成本和令牌使用量产生了最高质量的艺术输出。虽然 Gemini 3.6 Flash 在目标复制中获得了最高的客观结构相似度(SSIM)分数,但 Claude Fable 5 被发现成本极高——大约是竞争对手的 20 倍——却没有提供成正比的质量提升。Grok 4.5 表现糟糕,经常无法生成可用图像。

The Drawing Arena Methodology

研究人员在一个空白白色画布上使用标准化的彩色铅笔工具集测试了四种视觉模型——GPT-5.6 SolClaude Fable 5Grok 4.5Gemini 3.6 Flash——与直接生成最终像素网格的图像生成模型不同,这些模型必须通过特定的工具调用迭代构建图像:

  • Drawing Tools: draw (batch marks), set_color, set_brush, and set_pressure (opacity).
  • Modification Tools: smudge (blend/soften regions), erase, and clear_canvas.
  • Observation Tools: view_target (reference image) and view_canvas (current state).
  • Planning: A plan no-op scratchpad for internal reasoning.

模型被分配了两个目标复制任务(蒙娜丽莎和梵高的《星夜》)以及五个开放式文本提示。性能通过目标运行的结构相似度指数(SSIM)和均方根误差(RMSE)进行衡量,并伴有定性评估和成本分析。

Performance Analysis: Quality vs. Efficiency

GPT-5.6 Sol: The Efficiency Leader

GPT-5.6 Sol 在整体质量和资源效率方面表现最佳。它显著地完全跳过了 set_* 工具,而是在每个 draw 调用内部内联定义了颜色、画笔和压力。这种精简的方法导致了显著降低的令牌使用量和成本(七幅画作共计 $7.74)。

Claude Fable 5: High Cost, Diminishing Returns

Claude Fable 5 展示了成本与输出之间的显著差距。七幅画作的估计成本为 $160.58——大约是 GPT-5.6 Sol 的 20 倍。尽管投入了如此高的成本并且工具调用量更大(特别是 smudgeview_canvas),但它在质量上并未超过 Sol。

Gemini 3.6 Flash: High Structural Accuracy

Gemini 3.6 Flash 达到了最高的客观 SSIM 分数,蒙娜丽莎的峰值达到 0.449。然而,研究人员指出,虽然它在结构上与目标非常接近,但不一定对人类观察者来说是最美观的。它也是 view_canvas 工具的最频繁使用者,平均每幅画作进行 23 次自我审查。

Grok 4.5: Significant Capability Gap

Grok 4.5 在任务中挣扎,经常产生不可用或“超现实”的结果。它采用了高度低效的工具调用模式,65% 的调用用于 set_colorset_brushset_pressure,导致每幅画作平均 99 步却未能产生可用的视觉输出。

Key Findings on Iterative Improvement

最关键的发现之一是:模型往往会早期达到平台,并且随着时间的推移会降低自己的工作质量。

在所有八次目标复制运行中,最终的绘图得分都低于模型在中期达到的最佳版本。例如,Gemini 3.6 Flash 在蒙娜丽莎上达到的峰值 SSIM 为 0.449,但最终降至 0.337。这表明模型缺乏“恢复”机制,并且会在超过峰值性能后继续编辑,这种行为在某种程度上类似于一些模型在编码任务中的做法——通过添加更多代码来修复之前的错误,而不是移除损坏的元素。

Comparative Metrics Table

模型 平均步骤 平均时间 总 Token 总成本 蒙娜丽莎最终 SSIM 蒙娜丽莎峰值 SSIM
GPT-5.6 Sol 29 6.2 min 3.4M $7.74 0.325 0.352
Claude Fable 5 54 12.5 min 14.6M $160.58 0.286 0.289
Grok 4.5 99 4.8 min 34.0M 0.151 0.152
Gemini 3.6 Flash 73 6.9 min 27.7M $12.87 0.337 0.449

Community Insights and Critiques

技术观察者之间的讨论凸显了若干点关于测试的性质:

  • Artistic Maturity: 一些观察者指出输出看起来“天真”,反映了对对象的概念理解(例如,“蓝色 = 玻璃”),而不是对光、形状和折射的理解。
  • Inference Innovation: GPT-5.6 Sol 的效率被视为 OpenAI 在推理和令牌管理方面悄然创新的证据。
  • Metric Validity: 批评者认为 SSIM/RMSE 是基于像素的指标,可能与人类艺术判断不一致,并建议通过 DINOv2 使用余弦相似度以更好地与视觉质量对齐。

Sources