AI Labs Pelicanmaxxing인가? 1,008‑SVG 실험의 증거
AI Labs Pelicanmaxxing인가? 1,008‑SVG 실험의 증거
Overview
증거가 AI 랩이 pelicanmaxxing을 하고 있음을 보여주지 않습니다. 일곱 개의 프론티어 모델에서 펠리칸은 동물 그림 품질의 하위 절반에 위치하고, 자전거는 차량 품질의 하위 근처에 위치하며, 난이도를 조정한 후 펠리칸‑자전거 셀은 통계적으로 유의미한 향상을 일으키지 않습니다.
Methodology
나는 OpenRouter를 통해 일곱 개 모델을 테스트했습니다: GPT‑5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7‑Max, GLM‑5.2, 그리고 DeepSeek V4 Pro. 48개의 동물‑차량 프롬프트(8마리 동물 × 6대 차량) 각각에 대해 온도 1.0에서 세 개의 SVG를 생성하여 총 1,008개의 이미지를 얻었습니다. 각 SVG는 PNG로 렌더링되었으며, hanya 11개만 재생성이 필요했습니다. 점수는 세 단계 파이프라인에서 나왔습니다: GPT‑5.6 Luna가 동물, 차량, 일관성을 1‑5 척도로 판단했고, Gemini 3.1 Flash‑Lite가 인식된 동물, 차량, 방향, 장면 요소를 추출했습니다.
Evidence 1: Visual inspection shows no obvious pelican‑bicycle advantage
원본 이미지를 살펴보면, 해당 모델의 그리드 중에서 펠리칸‑자전거 그림이 눈에 띄게 더 나은 것으로 보이지 않았습니다. 펠리칸‑자전거 샘플은 각 모델이 생성하는 다른 동물‑차량 조합과 비슷해 보입니다.
Evidence 2: Pelican ratings are average
모든 모델의 동물 평점을 평균내면, 펠리칸은 8마리 동물 중 6위를 차지하며, 고양이, 고래, 라쿤, 왜가리, 안텔로프 뒤에 위치합니다. 랩이 펠리칸 벤치마크에서 훈련하고 있다면 펠리칸은 상위에 위치할 것으로 예상되었지만, 실제로는 하위 절반에 머무르고 있습니다.
Evidence 3: Bicycle ratings are low
자전거 평점은 최하위에서 두 번째이며, 비행기 바로 위에 위치합니다. 랩은 다른 차량보다 자전거를 더 잘 그리지 못하며, 낮은 점수는 두 개의 일치하는 바퀴, 프레임, 핸들바, 시트, 페달을 렌더링하는 inherent difficulty를 반영합니다.
Evidence 4: Regression shows no significant lab‑specific boost
고정 효과 회귀(score ~ lab + animal × vehicle)에서 펠리칸, 자전거, 그리고 펠리칸‑자전거 셀에 대한 각 랩별 상호작용 항목을 포함한 결과는 다음과 같습니다:
- 펠리칸 효과는 –0.11에서 +0.14 판단점 사이이며 (최소 p = 0.25).
- 자전거 효과는 Grok 4.5에서 –0.18 (p=0.11)부터 Gemini 3.5 Flash에서 +0.27 (p=0.022)까지이며, 오직 Gemini만이 p < 0.05를 통과합니다.
- 펠리칸‑자전거 상호작용은 p < 0.05에 도달하지 못하며, 가장 큰 양수는 GLM‑5.2에서 +0.35 (p=0.12)입니다. 모든 신뢰 구간이 zéro를 포함하여, 벤치마크에서 랩별 통계적으로 유의미한 증가가 없음을 나타냅니다.
Evidence 5: Scene composition does not indicate memorization
펠리칸‑자전거 이미지 21개 모두 오른쪽을 바라보지만, 오른쪽을 바라보는 것은 일반적입니다: 전체 이미지의 60%가 그렇게 하며, 자전거는 오른쪽을 바라보는 경향이 가장 강한 두 대의 차량 중 하나입니다(81%). 펠리칸도 오른쪽을 바라보는 경향이 있습니다(78%). 따라서 일관된 방향은 기억된 구성이 아니라 일반적인 편향과 일치합니다. 장면 요소 추출에서는 펠리칸‑자전거 이미지에만 고유한 반복되는 요소 세트가 보이지 않았으며, 각 동물‑차량 쌍은 자신만의 빈번한 요소를 보입니다(예: 플라밍고‑보트 위의 태양, 고양이‑자전거 위의 바구니).
Limitations
- 점수는 단일 LLM 판사(GPT‑5.6 Luna)에 의존하며, 판사 간 신뢰도는 측정되지 않았습니다.
- 이 실험은 모든 셀을 동등하게 끌어올리는 광범위한 SVGmaxxing을 감지할 수 없습니다.
- 약 $80의 API 예산으로 인해 셀당 세 개의 샘플, 단일 판사, 일곱 개 모델로 제한되었습니다.
Conclusion
AI 랩이 pelicanmaxxing을 하고 있다는 증거는 거의 없습니다. 펠리칸은 다른 동물보다 더 잘 그려지지 않으며, 자전거는 다른 차량보다 더 잘 그려지지 않으며, 펠리칸‑자전거 조합은 부분의 합을 초과하지 않습니다. 가장 가까운 신호(GLM‑5.2의 +0.35 향상)는 작고 통계적으로 유의미하지 않습니다.
Community reactions
"이건 환상적이에요. 저는 다른 차량의 다른 동물들을 casually spot‑checking 해왔는데, 여기서 절대적인 꿈 상황은 다른 조합보다 자전거 위의 펠리칸을 demonstrably 더 잘 그리는 AI 랩을 잡는 거예요." – @simonw "모든 21개의 펠리칸‑자전거 이미지는 일곱 개 랩 모두 오른쪽을 바라보고 있습니다. 다른 동물/차량 조합은 그렇게 하지 않습니다. 그러나 오른쪽을 바라보는 것은 일반적입니다: 1,008개의 이미지 중 60%가 그렇게 합니다…" – @mauvehaus "이 문제에 대해 숫자를 실행한 누군가가 있어서 기쁩니다. Simon Willison이 올린 모든 SVG 게시물은 누군가가 ‘지금은それに 훈련하고 있을 거라고 확신한다’고 말하며 뒤따릅니다." – @stusmall "더 plausibile한 이야기는 SVGmaxxing exatamente--그리고 이 시점에서 ‘maxxing’이 실제로 무엇을 의미하는지 스스로에게 물어봐야 합니다. 왜냐하면 ‘SVG 그리기 향상’은 유용한 기술이기 때문입니다." – @Wowfunhappy "누군가가 null 결과를 발표하는 것을 보는 것이 정말 상쾌합니다." – @nostrademons "기본 데이터는 GitHub에서 사용할 수 있습니다: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel..." – @simonw "LLM이 SVG를 뱉어내는 것은 인간 예술가가 좌표 목록을 단순히 읊조려서 무언가를 그리는 것과 비슷하다고 느껴요. 이는 insanely hard하고 unnatural합니다." – @dllu "지표를 쫓는 것, 드래곤을 쫓는 것, 토마토, 토마토" – @RobRivera "랩이 특별히 pelicanmaxxing을 하고 있는 것은 아니지만, SVG를 위한 일종의 RL 환경이 있어서そこに AIs를 과도하게 익히게 하고 있다는 느낌이 듭니다." – @ertgbnm "일인자전거 타는 사람으로서, 모든 옆으로 타는 것이 특히 어리석어서 내 눈을 끌었습니다. 그러나 대부분의 모델이 일부 동물에 대해서만 같은 옆으로 타는 실수를 하고 일관되게 반복한다는 사실에 매우 놀랐습니다." – @oasisbob "그들은 ‘Pelicanmaxxing’이 아닙니다… 그들은 ‘Ottermaxxing’입니다. GLM 5.2와 Deepseek V4의 ‘animal on a plane’ 예시를 살펴보세요." – @SyneRyder "저자가 모든 자전거 이미지가 오른쪽을 바라본다는 관찰은 거의 확실히 오른쪽에서 자전거를 촬영하는 관습 때문입니다." – @elliotto "이미지를 판단하도록 LLM을 선택한 것이 perplexing합니다." – @pasquinelli }