FROGS 基准测试:生成一只哈布斯堡下巴的青蛙的 SVG
FROGS 基准测试要求模型做什么
该基准测试要求每个模型根据单一提示“生成一只哈布斯堡下巴的青蛙的 SVG”来生成一个 SVG。每个模型每月有三次尝试。
基准测试的结构及数据集内容
该基准测试在 2026 年 8 月进行,共有 14 个模型、42 次运行和 42 个 SVG 输出。所有 SVG、运行元数据和注释均在 Hugging Face 和 GitHub 上以数据集名称 frogs 公开发布。
生成的 SVG 揭示了模型行为的哪些方面
这些 SVG 在文件大小上差异很大,最大的是 google/gemini-3.6-flash,达到 14,329 字节。单次运行中消耗最多标记的是 deepseek/deepseek-v4-pro,达到 16,228 个标记。许多模型添加了超出纯解剖学范围的注释,例如描述情绪、姿态或皇家符号。最具编辑性的模型是 google/gemini-3.6-flash,它贡献了 65 条注释式注释,包括诸如“Sad/Weary facial lines”和“Heavy Droopy Eyelids (Habsburg lethargic look)”之类的短语。未由解剖学请求暗示的皇家图像出现在 gemini-3.6-flash、deepseek-v4-pro、claude-opus-5、claude-sonnet-5、grok-4.5、glm-5.1 和 qwen3.7-max 的输出中。多个模型添加了诸如“droopy regal eyelids”、“arrogant” pupils、“Inbred Royal Disdain”和“half‑closed, giving a regal unimpressed look”等情绪‑姿态术语。mistralai/mistral-large-2512 在三次运行中产生了两个字节完全相同的 SVG,表明输出具有确定性。glm-5.1 和 qwen3.7-max 明确指出添加了王冠,并带有诸如“(because Habsburg)”或“(optional Habsburg reference)”之类的注释,显示了对皇家假设的自我意识。
评论者对结果的看法
Hacker News 上的评论者指出了各种反应。一位用户赞扬了 Opus 5,说 "Kudos to Opus 5, I thought it was the only one that came close to passing",并指出许多失败虽然画出了可识别的青蛙脸,但附加了一个与脸部不太融合的下巴块 {https://news.ycombinator.com/item?id=49148044}。另一位观察到没有任何尝试使用侧面轮廓,认为下巴形状在侧面更突出,而仅使用正面视角使任务更难 {https://news.ycombinator.com/item?id=49149617}。基准测试作者指出该站点正在收到意外流量,并提到个人对 google/gemini-3.6-flash SVG 的偏好 {https://news.ycombinator.com/item?id=49148152}。另一位评论者称该基准测试 "strong",并表示 "None of these could be remotely mistaken for human art. Opus 5 comes closest" {https://news.ycombinator.com/item?id=49147998}。一位用户总结了感知到的排名:"It's opus 5 > Kimi K3 > grok 4.5 That's a pretty good benchmark" {https://news.ycombinator.com/item?id=49148457}。另一位指出所有图像都是正面朝前的,并建议使用侧面或 3/4 视角能更好地展示哈布斯堡下巴 {https://news.ycombinator.com/item?id=49152837}。一位用户质疑图像生成基准测试的相关性,问 "Why do people benchmark these things on image generation? Surely that is not what most people here are using them for..." {https://news.ycombinator.com/item?id=49159943}。最后,一位评论者指出 Gemini 2.5 Pro 虽然未能满足提示,但具有独特的艺术风格和强烈的阴影 {https://news.ycombinator.com/item?id=49148897}。
要点:为什么此基准测试很重要
FROGS 基准测试揭示了模型如何解释单一特定的解剖学提示,展示了视觉保真度的变化、倾向于用皇家或情感叙事进行装饰的倾向,以及输出大小和确定性的差异。这些差异提供了对每个模型倾向于字面遵循指令还是添加上下文或风格元素的洞察,这对于评估指令忠实度和创造性泛化可能很有用。