AI 实验室是在进行 Pelicanmaxxing 吗?来自 1,008 个 SVG 实验的证据
AI 实验室是在进行 Pelicanmaxxing 吗?来自 1,008 个 SVG 实验的证据
概述
没有证据表明 AI 实验室正在进行 pelicanmaxxing。在七个前沿模型中,鹈鹕在动物绘画质量中排名后半段,自行车在车辆质量中排名接近底部,且在调整难度后,鹈鹕-自行车单元并未产生统计学意义上的提升。
方法论
我通过 OpenRouter 测试了七个模型:GPT‑5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7‑Max, GLM‑5.2, 和 DeepSeek V4 Pro。对于 48 个动物-车辆提示词(8 种动物 × 6 种车辆)中的每一个,我在 temperature 1.0 下生成了三个 SVG,共计 1,008 张图像。每个 SVG 都被渲染为 PNG;仅有 11 个需要重新生成。评分来自一个三阶段流水线:GPT‑5.6 Luna 根据 1-5 分的量表对动物、车辆和连贯性进行评判;Gemini 3.1 Flash‑Lite 提取识别出的动物、车辆、朝向和场景元素。
证据 1:视觉检查显示没有明显的鹈鹕-自行车优势
观察原始图像,没有任何一张鹈鹕-自行车的绘画明显优于该模型网格中的其他图像。鹈鹕-自行车的样本看起来与每个模型生成的其他动物-车辆组合没什么两样。
证据 2:鹈鹕评分处于平均水平
当对所有模型的动物评分取平均值时,鹈鹕在 8 种动物中排名第 6,排在猫、鲸鱼、浣熊、苍鹭和羚羊之后。如果实验室是在针对鹈鹕基准进行训练,那么鹈鹕理应排在首位;相反,它们处于后半部分。
证据 3:自行车评分较低
自行车评分排名倒数第二,仅高于飞机。实验室画出的自行车并不比其他车辆更好;低分反映了渲染两个匹配的轮子、车架、车把、座垫和踏板的固有难度。
证据 4:回归分析显示没有显著的特定实验室提升
使用包含鹈鹕、自行车和鹈鹕-自行车单元的每实验室交互项的固定效应回归(score ~ lab + animal × vehicle)发现:
- 鹈鹕效应范围为 –0.11 到 +0.14 评分点(最小 p = 0.25)。
- 自行车效应范围为 –0.18 (Grok 4.5, p=0.11) 到 +0.27 (Gemini 3.5 Flash, p=0.022);只有 Gemini 达到了 p < 0.05。
- 没有鹈鹕-自行车的交互项达到 p < 0.05;最大的正向值是 GLM‑5.2 的 +0.35 (p=0.12)。 所有置信区间都包含零,表明在基准测试上没有统计学意义上的特定实验室提升。
证据 5:场景构成并不表明存在记忆效应
所有 21 张鹈鹕-自行车的图像都面朝右侧,但面朝右侧是很常见的:所有图像中有 60% 是这样做的,而且自行车是两种具有最强向右倾向的车辆之一 (81%)。鹈鹕也倾向于面朝右侧 (78%)。因此,统一的方向符合普遍偏好,而非记忆中的构图。场景元素提取显示,没有发现仅属于鹈鹕-自行车图像的重复元素集;每个动物-车辆对都表现出其特有的频繁元素(例如,火烈鸟-船上的太阳,猫-自行车上的篮子)。
局限性
- 评分依赖于单个 LLM 评判者 (GPT‑5.6 Luna);未测量评判者间的一致性。
- 该实验无法检测到能平等提升所有单元的广泛 SVGmaxxing。
- 由于约 $80 的 API 预算限制,每个单元仅限三个样本、单个评判者和七个模型。
结论
几乎没有证据表明 AI 实验室正在进行 pelicanmaxxing。鹈鹕的绘画质量并不优于其他动物,自行车的绘画质量并不优于其他车辆,且鹈鹕-自行车的组合并没有超过其各部分之和。最接近的信号(GLM‑5.2 的 +0.35 提升)很小且不具统计学意义。
社区反应
"这太棒了,我一直在随手抽查其他车辆中的其他动物,因为我在这里最梦想的情况是抓到一个在鹈鹕骑自行车方面明显优于其他组合的 AI 实验室。" – @simonw
"在所有七个实验室中,所有 21 张鹈鹕-自行车的图像都面朝右。没有其他动物/车辆组合会这样做。然而,面朝右是很常见的:所有 1,008 张图像中有 60% 是这样做的……" – @mauvehaus
"我很高兴有人对这个进行了数据分析。每一个 Simon Willison 关于 SVG 的帖子后面都会跟着有人否定它,说‘我确信他们现在肯定已经在用它进行训练了。’" – @stusmall
"更合理的说法是 SVGmaxxing —— 没错,此时你必须问自己‘maxxing’到底意味着什么,因为‘变得更擅长画 SVG’是一项有用的技能。" – @Wowfunhappy
"看到有人发布一个无效结果(null result)真的很令人耳目一新。" – @nostrademons
"底层数据可在 GitHub 上获取:https://github.com/dylanjcastillo/blog/tree/main/_extras/pel..." – @simonw
"让 LLM 吐出一个 SVG 感觉就像让一名人类艺术家仅通过背诵一系列坐标来画画一样。这极其困难且不自然。" – @dllu
"追逐指标,追逐幻象,Tomato, tomato" – @RobRivera
"我一直觉得实验室并不是专门在进行 pelicanmaxxing,但他们确实为 SVG 准备了某种 RL 环境,并让 AI 在其中过度训练。" – @ertgbnm
"作为一个单轮车骑行者,所有侧向骑行的画面都让我觉得特别滑稽。然而,我很惊讶大多数模型在仅有部分动物时会犯同样的侧向错误,而且它们做得很一致。" – @oasisbob
"它们不是在‘Pelicanmaxxing’……它们是在‘Ottermaxxing’。看看 GLM 5.2 和 Deepseek V4 的‘动物在飞机上’的例子。" – @SyneRyder
"作者观察到所有自行车图像都面朝右,这几乎肯定与从右侧拍摄自行车的惯例有关。" – @elliotto
"我对选择一个 LLM 来评判图像感到困惑。" – @pasquinelli