AI 實驗室是否在 Pelicanmaxxing?來自 1,008‑SVG 實驗的證據

AI 實驗室是否在 Pelicanmaxxing?來自 1,008‑SVG 實驗的證據

總覽

沒有證據顯示 AI 實驗室在進行 pelicanmaxxing。在七個前沿模型中,pelican 在動物繪圖品質排名處於下半段,bicycle 在車輛品質排名接近底部,且在調整難度後,pelican‑bicycle 單元並未產生統計顯著的提升。

方法論

我透過 OpenRouter 測試了七個模型:GPT‑5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7‑Max、GLM‑5.2 和 DeepSeek V4 Pro。對於每個 48 個動物‑車輛提示(8 種動物 × 6 種車輛),我在溫度 1.0 下生成了三個 SVG,共得到 1,008 張圖像。每個 SVG 都渲染為 PNG;只有 11 張需要重新生成。分數來自三階段管道:GPT‑5.6 Luna 在 1‑5 分制上評分動物、車輛和連貫性;Gemini 3.1 Flash‑Lite 提取識別出的動物、車輛、面向方向和場景元素。

證據 1:目視檢查顯示沒有明顯的 pelican‑bicycle 優勢

查看原始圖像時,沒有任何 pelican‑bicycle 繪圖明顯優於該模型網格的其他部分。pelican‑bicycle 樣本看起來與每個模型產生的其他動物‑車輛組合相似。

證據 2:Pelican 評分屬於平均水平

將所有模型的動物評分取平均後,pelican 在 8 種動物中排名第 6,排在貓、鯨魚、浣熊、鷺鳥和羚羊之後。如果實驗室是在 pelican 基準上進行訓練,pelican 應該會排名靠前;但事實上它們位於下半段。

證據 3:Bicycle 評分偏低

Bicycle 評分排名倒數第二,僅高於飛機。實驗室並未將 bicycle 繪製得比其他車輛更好;低分反映了繪製兩個匹配車輪、車架、把手、座椅和踏板的固有難度。

證據 4:迴歸顯示沒有顯著的實驗室特定提升

固定效應迴歸(score ~ lab + animal × vehicle)並加入每個實驗室對 pelican、bicycle 以及 pelican‑bicycle 單元的交互項,得到以下結果:

  • Pelican 的效果範圍為 –0.11 至 +0.14 評分點(最小 p 值為 0.25)。
  • Bicycle 的效果範圍為 –0.18(Grok 4.5,p=0.11)至 +0.27(Gemini 3.5 Flash,p=0.022);只有 Gemini 的 p 值低於 0.05。
  • 沒有 pelican‑bicycle 交互項達到 p < 0.05;最大的正向效應來自 GLM‑5.2,為 +0.35(p=0.12)。 所有置信區間都包含零,表明在該基準上沒有統計顯著的實驗室特定提升。

證據 5:場景組成不表示記憶

所有 21 張 pelican‑bicycle 圖像都朝右,但朝右是常見的:所有圖像中有 60% 朝右,而 bicycle 是兩種具有最強右向傾向的車輛之一(81%)。pelican 也傾向於朝右(78%)。因此,這個一致的方向更符合一般偏見,而非記憶中的組合。場景元素提取顯示沒有出現唯一於 pelican‑bicycle 圖像的重複元素集;每個動物‑車輛組合都有其自身常見的元素(例如,flamingo‑boat 上的太陽,cat‑bicycle 上的籃子)。

限制

  • 分數依賴於單一 LLM 評判者(GPT‑5.6 Luna);未測量跨評判者的可靠性。
  • 此實驗無法偵測到提升所有單元的廣泛 SVGmaxxing。
  • 受限於每個單元三個樣本、單一評判者以及七個模型,這是由於約 80 美元的 API 預算。

結論

幾乎沒有證據顯示 AI 實驗室在進行 pelicanmaxxing。pelican 的繪製品質不及其他動物,bicycle 的繪製品質不及其他車輛,且 pelican‑bicycle 組合未超過其各部分之和。最接近的訊號(GLM‑5.2 的 +0.35 提升)幅度小且不具統計顯著性。

社區反應

"這太棒了,我一直在隨意檢查其他車輛中的其他動物,因為我的絕對夢想情境是抓到一個 AI 實驗室,該實驗室明顯在腳踏車上的 pelican 表現優於其他組合。" – @simonw "所有 21 張 pelican‑bicycle 圖像,在七個實驗室中都朝右。沒有其他動物/車輛組合如此。然而,朝右是常見的:1,008 張圖像中有 60% 如此…" – @mauvehaus "我很高興有人為此進行了數據分析。每一篇 Simon Willison 關於 SVG 的貼文都會有人出來否定,說『我確定他們現在已經在訓練這個了。』" – @stusmall "更合理的說法是 SVGmaxxing——而且你必須在此時問自己 ‘maxxing’ 真正意味著什麼,因為 ‘提升繪製 SVG 的能力’ 是一項有用的技能。" – @Wowfunhappy "看到有人發表零結果真的令人耳目一新。" – @nostrademons "基礎數據可在 GitHub 上獲得:https://github.com/dylanjcastillo/blog/tree/main/_extras/pel..." – @simonw "我覺得讓 LLM 輸出 SVG 就像讓人類藝術家僅憑坐標列表來繪製某物。這既瘋狂又不自然。" – @dllu "追逐指標 追逐龍 蕃茄,蕃茄" – @RobRivera "我一直覺得實驗室並不是特別在進行 pelicanmaxxing,但它們確實擁有一種用於 SVG 的 RL 環境,讓 AI 在其中過度訓練。" – @ertgbnm "作為一名獨輪車騎手,所有側向騎行都引起了我的注意,因為這特別愚蠢。然而,我對多數模型在僅部分動物上犯下相同的側向錯誤並且保持一致感到非常驚訝。" – @oasisbob "它們並不是 ‘Pelicanmaxxing’……而是 ‘Ottermaxxing’。請看 GLM 5.2 和 Deepseek V4 的 ‘animal on a plane’ 範例。" – @SyneRyder "作者觀察到所有 bicycle 圖像面向右,這幾乎肯定與從右側拍攝 bicycle 的慣例有關。" – @elliotto "我對選擇讓 LLM 評判圖像感到困惑。" – @pasquinelli }

Sources