FROGS 벤치마크: 하브스부르크 턱을 가진 개구리 SVG 생성
FROGS 벤치마크가 모델에게 요구하는 것
벤치마크는 각 모델에게 단일 프롬프트 “Generate an SVG of a frog with a Habsburg jaw”(하브스부르크 턱을 가진 개구리 SVG 생성)로 하브스부르크 턱을 가진 개구리 SVG를 만들도록 요구합니다. 각 모델은 한 달에 세 번의 시도를 받을 수 있습니다.
벤치마크 구조와 데이터셋 내용
벤치마크는 2026년 8월에 14개의 모델, 42개의 실행, 42개의 SVG 출력으로 진행되었습니다. 모든 SVG, 실행 메타데이터 및 주석은 Hugging Face와 GitHub에 데이터셋 이름 frogs 로 공개되어 있습니다.
생성된 SVG가 보여주는 모델 행동
SVG는 파일 크기가 크게 차이 나며, 가장 큰 것은 google/gemini-3.6-flash 로 14,329 바이트였습니다. 한 번의 실행에서 가장 많은 토큰을 사용한 것은 deepseek/deepseek-v4-pro 로 16,228 토큰이었습니다. 많은 모델이 순수 해부학을 넘어 기분, 분위기 또는 왕실 상징을 설명하는 주석을 추가했습니다. 가장 많이 편집된 모델은 google/gemini-3.6-flash 로, “Sad/Weary facial lines”(슬프고 피곤한 얼굴 선)와 “Heavy Droopy Eyelids (Habsburg lethargic look)”(무거운 처진 눈꺼풀 (하브스부르크식 무기력한 모습))와 같은 구문을 포함한 65개의 주석‑스타일 주석을 기여했습니다. 해부학적 요청에 암시되지 않은 왕실 이미지가 gemini-3.6-flash, deepseek-v4-pro, claude-opus-5, claude-sonnet-5, grok-4.5, glm-5.1, qwen3.7-max 의 출력에 나타났습니다. “droopy regal eyelids”(처진 왕실 눈꺼풀), “arrogant”(거만한) pupils, “Inbred Royal Disdain”(근친 왕실 경멸), “half‑closed, giving a regal unimpressed look”(반쯤 감긴, 왕실의 무관심한 표정)와 같은 분위기‑표현 용어가 여러 모델에 의해 추가되었습니다. mistralai/mistral-large-2512는 세 번의 실행 중 두 개가 바이트‑동일한 SVG를 생성해 결정론적 출력을 보여줍니다. glm-5.1과 qwen3.7-max는 “(because Habsburg)”(하브스부르크 때문) 또는 “(optional Habsburg reference)”(선택적 하브스부르크 참조)와 같은 주석으로 왕관을 명시적으로 추가해, 왕실 가정이 자체 인식임을 보여줍니다.
댓글자들의 의견
Hacker News의 댓글자들은 다양한 반응을 보였습니다. 한 사용자는 Opus 5를 칭찬하며 “Kudos to Opus 5, I thought it was the only one that came close to passing”이라고 말하고, 많은 실패 사례가 개구리 얼굴은 인식 가능하지만 턱 덩어리가 얼굴과 잘 통합되지 않았다고 지적했습니다 {https://news.ycombinator.com/item?id=49148044}. 또 다른 사용자는 모든 시도가 측면 프로필을 사용하지 않았다고 지적하며, 턱 형태는 측면에서 더 두드러지므로 정면만으로는 과제가 더 어려워진다고 주장했습니다 {https://news.ycombinator.com/item?id=49149617}. 벤치마크 작성자는 사이트에 예상치 못한 트래픽이 몰리고 있으며, 개인적으로 google/gemini-3.6-flash SVG를 선호한다고 언급했습니다 {https://news.ycombinator.com/item?id=49148152}. 다른 댓글자는 벤치마크를 “strong”(강력)하다고 부르며 “None of these could be remotely mistaken for human art. Opus 5 comes closest”라고 말했습니다 {https://news.ycombinator.com/item?id=49147998}. 한 사용자는 인식된 순위를 요약하며 “It's opus 5 > Kimi K3 > grok 4.5 That's a pretty good benchmark”라고 했습니다 {https://news.ycombinator.com/item?id=49148457}. 또 다른 사용자는 모든 이미지가 정면이며, 프로필이나 3/4 뷰가 하브스부르크 턱을 더 잘 보여줄 것이라고 제안했습니다 {https://news.ycombinator.com/item?id=49152837}. 한 사용자는 이미지‑생성 벤치마크의 관련성을 질문하며 “Why do people benchmark these things on image generation? Surely that is not what most people here are using them for...”라고 물었습니다 {https://news.ycombinator.com/item?id=49159943}. 마지막으로, 한 댓글자는 Gemini 2.5 Pro는 프롬프트에 실패했지만 독특한 예술 스타일과 강한 음영을 가지고 있었다고 언급했습니다 {https://news.ycombinator.com/item?id=49148897}.
요약: 이 벤치마크가 중요한 이유
FROGS 벤치마크는 모델이 단일, 구체적인 해부학 프롬프트를 어떻게 해석하는지를 보여주며, 시각적 충실도, 왕실 또는 감정 서사를 추가하려는 경향, 출력 크기와 결정론성의 차이를 드러냅니다. 이러한 차이는 모델이 지시를 문자 그대로 따르는지, 컨텍스트나 스타일 요소를 추가하는지를 파악하는 데 도움이 되며, 지시 충실도와 창의적 일반화를 평가하는 데 유용합니다.