Pelican-bicycle 替代方案 2026 基准测试揭示各大 LLM 的 SVG 生成进展
快速要点
更新后的 2026 Pelican-bicycle SVG 基准测试表明,来自 OpenAI、Anthropic、Google、DeepSeek、Alibaba 等公司的旗舰模型现在能够为荒诞提示生成连贯、详细的矢量图形,延迟和成本差异不大,而社区讨论则突出了新兴的性价比权衡和风格同质化。
基准测试衡量什么
- 提示:一个简短的、异想天开的描述(例如,“一只章鱼在演奏管风琴”)。
- 输出:每个模型生成的 SVG 图像。
- 报告的指标:生成时间和每次请求的 API 成本。
- 模型集:两次运行——2026 年运行(6 个模型)和 2025 年运行(9–10 个模型),涵盖 GPT‑6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4 Pro、Qwen 3.8 Max 和 Fugu Ultra v2,以及更广泛的 2025 年名单(Claude Sonnet 4.5、Claude Opus 4.5、GPT‑5.1、GPT‑5.2 Pro、Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Grok Code Fast 1、DeepSeek V3.2‑Exp、GLM‑4.6、Qwen3‑VL‑235B‑A22B‑Thinking)。
按模型系列的性能概览
| 模型系列 | 典型延迟(2026 年运行) | 典型成本(2026 年运行) | 显著视觉特征 |
|---|---|---|---|
| OpenAI GPT‑6 Astra | 1–2 分钟 | $0.20‑$0.37 | 线条干净,解剖结构一致 |
| Anthropic Claude Fable 5.1 | 1–3 分钟 | $0.46‑$0.79 | 色彩略微更丰富 |
| Google Gemini 3.8 Flash | 2–5 分钟 | $0.07‑$0.12 | 通常更鲜艳但偶尔模糊 |
| DeepSeek V4 Pro | 1–5 分钟 | $0.04‑$0.10 | 极简风格,低成本 |
| Alibaba Qwen 3.8 Max | 9–15 分钟 | $0.15‑$0.27 | 延迟较高,成本有竞争力 |
| Sakana AI Fugu Ultra v2 | 2–14 分钟 | $0.35‑$2.05 | 成本最高,细节多变 |
观察:正如一条社区评论所指出的,Gemini 3.8 Flash 在许多提示下提供了最佳的性价比。
成本‑性能趋势
- 延迟:较新的模型普遍有所下降(例如,GPT‑6 Astra 约 2 分钟,而 2025 年的 GPT‑5.1 约 2 分钟),同时保持了相似的质量。
- API 成本:目前大多数模型集中在 $0.05‑$0.30 左右,但也有例外,如 Fugu Ultra v2(最高 $2.05)和 DeepSeek V4 Pro(低至 $0.04)。
- 社区成员 @BrokenCogs 强调 Gemini 3.8 Flash 是一个具有强大成本‑性能表现的例外。
讨论中的视觉质量见解
- 风格趋同:多位评论者(例如,@outlore、@dustfinger)观察到不同模型生成的构图惊人地相似——例如,驼鹿始终站在旋转木马的左侧。
- 解剖学挑战:@samayashar 指出仍然存在的问题,即模型错误地放置肢体(章鱼的触手从管风琴而不是身体中伸出)。
- 色彩与鲜艳度:@sajithdilshan 称赞 Gemini 3.8 相比其他提供商拥有更生动的调色板。
- 性价比质量:@andy_ppp 对 Qwen 3.8 相对于其价格的出色输出表示惊讶,呼应了之前的成本‑性能说明。
- 基准测试饱和:@svcrunch 引用了 Little Dorrit Benchmark,指出最高分数仍远未饱和(约 0.78 F1),这意味着还有进一步区分的空间。
基准测试的局限性
- 古德哈特定律:正如 @vova_hn2 所警告的,基准测试可能过度拟合;模型可能从训练数据中记住了类似的 SVG 任务,降低了其探测涌现推理的能力。
- 缺乏负空间处理:@theshrike79 观察到 SVG 输出避免了光栅生成器中常见的“填满一切”伪影,但这也掩盖了处理空白区域的潜在弱点。
- 缺失提示:2026 年的几个提示(例如,树懒驾驶挖掘机、蜻蜓平衡枝形吊灯)尚未生成,限制了对 2026 年的完整比较。
社区驱动的未来扩展想法
- 动画 SVG:@qiine 建议增加动画维度以提高难度。
- 折纸折叠任务:@eddytrex_ 提出了一个基于 SVG 的折纸基准测试。
- 廉价模型的参数扫描:@miohtama 希望有迭代检查和修复循环来改进低成本模型的输出。
SVG 生成基准测试的未来方向
- 更广泛的提示多样性——引入需要明确负空间推理或多步组合的任务。
- 动态评估——自动化 F1 风格评分(如 Little Dorrit Benchmark 中那样)以量化对齐质量。
- 成本归一化排名——发布一个按质量和延迟及 API 价格归一化的排行榜,使权衡透明化。
- 开源参考实现——提供一个基线 SVG 渲染器,以验证生成的代码在语法上有效并能跨浏览器一致渲染。
最终评估
2026 Pelican-bicycle SVG 基准测试证实,主流 LLM 已达到一个成熟水平,能够可靠地生成异想天开的矢量图形,延迟和成本在各供应商之间现已相当。然而,社区对风格同质化、挥之不去的解剖学故障以及潜在基准过度拟合的观察表明,未来的工作应侧重于更丰富、成本感知的评估指标和更具挑战性的组合任务。
社区评论:Gemini 3.8 Flash 提供了最佳的性价比。— @BrokenCogs 模型似乎记住了类似的 SVG 任务,基准测试可能过度拟合。— @vova_hn2 SVG 输出避免了“填满一切”的伪影,但也掩盖了负空间处理的弱点。— @theshrike79
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch