Pelican-bicycle 替代方案 2026 基准测试揭示各大 LLM 的 SVG 生成进展

快速要点

更新后的 2026 Pelican-bicycle SVG 基准测试表明,来自 OpenAI、Anthropic、Google、DeepSeek、Alibaba 等公司的旗舰模型现在能够为荒诞提示生成连贯、详细的矢量图形,延迟和成本差异不大,而社区讨论则突出了新兴的性价比权衡和风格同质化。


基准测试衡量什么

  • 提示:一个简短的、异想天开的描述(例如,“一只章鱼在演奏管风琴”)。
  • 输出:每个模型生成的 SVG 图像。
  • 报告的指标:生成时间和每次请求的 API 成本。
  • 模型集:两次运行——2026 年运行(6 个模型)和 2025 年运行(9–10 个模型),涵盖 GPT‑6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4 Pro、Qwen 3.8 Max 和 Fugu Ultra v2,以及更广泛的 2025 年名单(Claude Sonnet 4.5、Claude Opus 4.5、GPT‑5.1、GPT‑5.2 Pro、Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Grok Code Fast 1、DeepSeek V3.2‑Exp、GLM‑4.6、Qwen3‑VL‑235B‑A22B‑Thinking)。

按模型系列的性能概览

模型系列 典型延迟(2026 年运行) 典型成本(2026 年运行) 显著视觉特征
OpenAI GPT‑6 Astra 1–2 分钟 $0.20‑$0.37 线条干净,解剖结构一致
Anthropic Claude Fable 5.1 1–3 分钟 $0.46‑$0.79 色彩略微更丰富
Google Gemini 3.8 Flash 2–5 分钟 $0.07‑$0.12 通常更鲜艳但偶尔模糊
DeepSeek V4 Pro 1–5 分钟 $0.04‑$0.10 极简风格,低成本
Alibaba Qwen 3.8 Max 9–15 分钟 $0.15‑$0.27 延迟较高,成本有竞争力
Sakana AI Fugu Ultra v2 2–14 分钟 $0.35‑$2.05 成本最高,细节多变

观察:正如一条社区评论所指出的,Gemini 3.8 Flash 在许多提示下提供了最佳的性价比


成本‑性能趋势

  • 延迟:较新的模型普遍有所下降(例如,GPT‑6 Astra 约 2 分钟,而 2025 年的 GPT‑5.1 约 2 分钟),同时保持了相似的质量。
  • API 成本:目前大多数模型集中在 $0.05‑$0.30 左右,但也有例外,如 Fugu Ultra v2(最高 $2.05)和 DeepSeek V4 Pro(低至 $0.04)。
  • 社区成员 @BrokenCogs 强调 Gemini 3.8 Flash 是一个具有强大成本‑性能表现的例外。

讨论中的视觉质量见解

  • 风格趋同:多位评论者(例如,@outlore@dustfinger)观察到不同模型生成的构图惊人地相似——例如,驼鹿始终站在旋转木马的左侧。
  • 解剖学挑战@samayashar 指出仍然存在的问题,即模型错误地放置肢体(章鱼的触手从管风琴而不是身体中伸出)。
  • 色彩与鲜艳度@sajithdilshan 称赞 Gemini 3.8 相比其他提供商拥有更生动的调色板。
  • 性价比质量@andy_ppp 对 Qwen 3.8 相对于其价格的出色输出表示惊讶,呼应了之前的成本‑性能说明。
  • 基准测试饱和@svcrunch 引用了 Little Dorrit Benchmark,指出最高分数仍远未饱和(约 0.78 F1),这意味着还有进一步区分的空间。

基准测试的局限性

  • 古德哈特定律:正如 @vova_hn2 所警告的,基准测试可能过度拟合;模型可能从训练数据中记住了类似的 SVG 任务,降低了其探测涌现推理的能力。
  • 缺乏负空间处理@theshrike79 观察到 SVG 输出避免了光栅生成器中常见的“填满一切”伪影,但这也掩盖了处理空白区域的潜在弱点。
  • 缺失提示:2026 年的几个提示(例如,树懒驾驶挖掘机、蜻蜓平衡枝形吊灯)尚未生成,限制了对 2026 年的完整比较。

社区驱动的未来扩展想法

  • 动画 SVG@qiine 建议增加动画维度以提高难度。
  • 折纸折叠任务@eddytrex_ 提出了一个基于 SVG 的折纸基准测试。
  • 廉价模型的参数扫描@miohtama 希望有迭代检查和修复循环来改进低成本模型的输出。

SVG 生成基准测试的未来方向

  1. 更广泛的提示多样性——引入需要明确负空间推理或多步组合的任务。
  2. 动态评估——自动化 F1 风格评分(如 Little Dorrit Benchmark 中那样)以量化对齐质量。
  3. 成本归一化排名——发布一个按质量和延迟及 API 价格归一化的排行榜,使权衡透明化。
  4. 开源参考实现——提供一个基线 SVG 渲染器,以验证生成的代码在语法上有效并能跨浏览器一致渲染。

最终评估

2026 Pelican-bicycle SVG 基准测试证实,主流 LLM 已达到一个成熟水平,能够可靠地生成异想天开的矢量图形,延迟和成本在各供应商之间现已相当。然而,社区对风格同质化、挥之不去的解剖学故障以及潜在基准过度拟合的观察表明,未来的工作应侧重于更丰富、成本感知的评估指标和更具挑战性的组合任务。


社区评论:Gemini 3.8 Flash 提供了最佳的性价比。— @BrokenCogs 模型似乎记住了类似的 SVG 任务,基准测试可能过度拟合。— @vova_hn2 SVG 输出避免了“填满一切”的伪影,但也掩盖了负空间处理的弱点。— @theshrike79

Sources

相关