FROGS 基準測試:生成一隻具有哈布斯堡下巴的青蛙的 SVG

FROGS 基準測試要求模型做什麼

該基準測試要求每個模型根據單一提示「Generate an SVG of a frog with a Habsburg jaw」生成一隻具有哈布斯堡下巴的青蛙的 SVG。每個模型每月獲得三次嘗試機會。

基準測試的結構及資料集內容

該基準測試於 2026 年 8 月進行,共有 14 個模型、42 次運行和 42 個 SVG 輸出。所有 SVG、運行元資料和註解均在 Hugging Face 和 GitHub 上以資料集名稱 frogs 公開提供。

生成的 SVG 揭示了模型行為

生成的 SVG 在檔案大小上差異甚大,最大的是 google/gemini-3.6-flash,達到 14,329 個位元組。單次運行中消耗最多標記的是 deepseek/deepseek-v4-pro,達到 16,228 個標記。許多模型加入了超出純解剖學範圍的註解,例如描述情緒、氣質或皇家符號。最具編輯性的模型是 google/gemini-3.6-flash,它貢獻了 65 條註解式註釋,包括「Sad/Weary facial lines」和「Heavy Droopy Eyelids (Habsburg lethargic look)」等短語。未由解剖學請求暗示的皇家圖像出現在 gemini-3.6-flash、deepseek-v4-pro、claude-opus-5、claude-sonnet-5、grok-4.5、glm-5.1 和 qwen3.7-max 的輸出中。多個模型加入了如「droopy regal eyelids」、「arrogant」瞳孔、「Inbred Royal Disdain」以及「half‑closed, giving a regal unimpressed look」等帶有情緒與氣質的詞彙。mistralai/mistral-large-2512 在三次運行中產生了兩個位元組完全相同的 SVG,顯示其輸出具有決定性。glm-5.1 和 qwen3.7-max 明確註明添加了王冠,並註釋如「(because Habsburg)」或「(optional Habsburg reference)」,顯示對皇家假設的自我認識。

評論者對結果的看法

Hacker News 的評論者指出了各種反應。一位用戶讚賞 Opus 5,說 "Kudos to Opus 5, I thought it was the only one that came close to passing",並指出許多失敗雖然畫出了可識別的青蛙臉,但附加了一塊下巴塊,與臉部結合不佳 {https://news.ycombinator.com/item?id=49148044}。另一位觀察到,嘗試中沒有任何一個使用側面圖,認為下巴形狀在側面更突出,而僅使用正面圖使任務變得更難 {https://news.ycombinator.com/item?id=49149617}。基準測試作者指出該網站正在收到意外流量,並提到他個人偏好 google/gemini-3.6-flash 的 SVG {https://news.ycombinator.com/item?id=49148152}。不同評論者稱此基準測試 "strong",並表示 "None of these could be remotely mistaken for human art. Opus 5 comes closest" {https://news.ycombinator.com/item?id=49147998}。一位用戶總結了一種 perceived 排名:"It's opus 5 > Kimi K3 > grok 4.5 That's a pretty good benchmark" {https://news.ycombinator.com/item?id=49148457}。另一位評論指出所有圖像都是正面朝向,並建議使用側面或 3/4 視圖能更好地展現哈布斯堡下巴 {https://news.ycombinator.com/item?id=49152837}。一位用戶質疑圖像生成基準測試的相關性,詢問 "Why do people benchmark these things on image generation? Surely that is not what most people here are using them for..." {https://news.ycombinator.com/item?id=49159943}。最後,一位評論者指出 Gemini 2.5 Pro 雖未通過提示,但具有獨特的藝術風格和強烈的陰影 {https://news.ycombinator.com/item?id=49148897}。

為什麼這個基準測試重要

FROGS 基準測試揭示了模型如何解釋單一、特定的解剖學提示,顯示在視覺保真度、添加皇家或敘事情感的傾向,以及輸出大小和決定性方面的差異。這些差異提供了每個模型傾向於逐字遵循指令與添加情境或風格元素的見解,這對評估指令忠誠度和創造性泛化很有用。

Sources