Pelican-bicycle 2026 年度替代方案基準測試揭示主要大型語言模型在 SVG 生成方面的進展
快速重點
更新的 2026 年度 Pelican‑bicycle SVG 基準測試顯示,OpenAI、Anthropic、Google、DeepSeek、Alibaba 等公司的旗艦模型如今能為荒謬提示生成清晰且細節豐富的向量圖形,僅在延遲和成本上存在微小差異,而社群討論則突顯出新出現的成本與效能之間的權衡,以及風格同質化的趨勢。
基準測試衡量的內容
- 提示:一段簡短而富有奇想的描述(例如:「一隻章魚操作管風琴」)。
- 輸出:由各模型生成的 SVG 圖像。
- 報告的指標:每次請求的生成時間與 API 成本。
- 模型組別:兩次測試——2026 年度測試(6 個模型)與 2025 年度測試(9–10 個模型),涵蓋 GPT‑6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4 Pro、Qwen 3.8 Max、Fugu Ultra v2,以及更廣泛的 2025 年度名單(Claude Sonnet 4.5、Claude Opus 4.5、GPT‑5.1、GPT‑5.2 Pro、Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Grok Code Fast 1、DeepSeek V3.2‑Exp、GLM‑4.6、Qwen3‑VL‑235B‑A22B‑Thinking)。
各模型家族的效能快照
| 模型家族 | 2026 年度測試的典型延遲 | 2026 年度測試的典型成本 | 顯著的視覺特徵 |
|---|---|---|---|
| OpenAI GPT‑6 Astra | 1–2 分鐘 | $0.20‑$0.37 | 線條乾淨,解剖結構一致 |
| Anthropic Claude Fable 5.1 | 1–3 分鐘 | $0.46‑$0.79 | 色彩調性略為豐富 |
| Google Gemini 3.8 Flash | 2–5 分鐘 | $0.07‑$0.12 | 通常更鮮豔,但偶爾模糊 |
| DeepSeek V4 Pro | 1–5 分鐘 | $0.04‑$0.10 | 极簡風格,成本低 |
| Alibaba Qwen 3.8 Max | 9–15 分鐘 | $0.15‑$0.27 | 延遲較高,成本具競爭力 |
| Sakana AI Fugu Ultra v2 | 2–14 分鐘 | $0.35‑$2.05 | 成本最高,細節不穩定 |
觀察:社群成員指出,Gemini 3.8 Flash 在許多提示下提供了最佳的「效能對成本」比。
成本與效能趨勢
- 延遲:新模型的延遲普遍下降(例如 GPT‑6 Astra 約 2 分鐘,對比 2025 年 GPT‑5.1 約 2 分鐘),同時維持相似品質。
- API 成本:目前大多數模型的成本集中在 $0.05‑$0.30 之間,例外如 Fugu Ultra v2(高達 $2.05)與 DeepSeek V4 Pro(低至 $0.04)。
- 社群成員 @BrokenCogs 強調 Gemini 3.8 Flash 是成本效能表現出色的異常值。
社群討論中的視覺品質洞察
- 風格趨同:多位評論者(例如 @outlore、@dustfinger)觀察到不同模型產生的構圖極為相似——例如,麋鹿在所有提供者的圖像中都穩定地站在摩天輪的左側。
- 解剖結構挑戰:@samayashar 指出模型仍存在肢體位置錯誤的問題(例如章魚的觸手從管風琴中長出,而非身體)。
- 色彩與鮮豔度:@sajithdilshan 贊揚 Gemini 3.8 的色彩調性比其他提供者更鮮豔。
- 高性價比品質:@andy_ppp 對 Qwen 3.8 的出色輸出與其價格之間的反差感到驚訝,呼應了先前的成本效能評論。
- 基準測試飽和度:@svcrunch 提及 Little Dorrit 基準測試,指出頂尖分數仍遠未達飽和(約 0.78 F1),暗示仍有進一步區分的空間。
基準測試的限制
- 古德哈特定律:如 @vova_hn2 所警告,此基準測試可能過度擬合;模型可能已從訓練資料中記憶類似 SVG 任務,削弱其探測新興推理能力的效用。
- 負空間處理不足:@theshrike79 觀察到 SVG 輸出避開了光柵生成器常見的「填滿所有區域」缺陷,但這也掩蓋了處理空白區域的潛在弱點。
- 遺漏的提示:數個 2026 年度提示(例如:樹懶駕駛挖土機、蜻蜓平衡吊燈)尚未生成,限制了完整的 2026 年度比較。
社群主導的未來擴展構想
- 動畫 SVG:@qiine 建議增加動畫維度以提升難度。
- 摺紙折疊任務:@eddytrex_ 提出建立基於 SVG 的摺紙基準測試。
- 低成本模型的參數掃描:@miohtama 希望能透過迭代檢視與修正迴圈,改善低成本模型的輸出。
SVG 生成基準測試的未來方向
- 更廣泛的提示多樣性 – 引入需要明確負空間推理或多步驟組合的任務。
- 動態評估 – 自動化 F1 式評分(如 Little Dorrit 基準測試),以量化對齊品質。
- 成本歸一化排名 – 發布一個將品質歸一化至延遲與 API 價格的排行榜,使權衡關係更透明。
- 開源參考實作 – 提供基準 SVG 渲染器,以驗證生成程式碼的語法正確性,並確保跨瀏覽器的一致性渲染。
最終評估
2026 年度 Pelican‑bicycle SVG 基準測試確認,主流大型語言模型已達到成熟水準,能可靠地生成奇想的向量圖形,且延遲與成本在各供應商之間已趨於可比。然而,社群觀察到的風格同質化、持續存在的解剖結構錯誤,以及基準測試可能過度擬合的潛在問題,顯示未來工作應聚焦於更豐富、具成本意識的評估指標,以及更具挑戰性的組合任務。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch