AI Drawing Arena: GPT-5.6 Sol, Claude Fable 5, Gemini 3.6 Flash, 그리고 Grok 4.5 비교
AI Drawing Arena: GPT-5.6 Sol, Claude Fable 5, Gemini 3.6 Flash, 그리고 Grok 4.5 비교
실행 요약
GPT-5.6 Sol은 그림 그리기 아레나 테스트에서 가장 성능이 좋고 효율적인 모델로 떠올랐으며, 가장 낮은 비용과 토큰 사용량으로 최고 품질의 예술적 출력을 생성했습니다. Gemini 3.6 Flash는 대상 재현에 대해 가장 높은 객관적 구조 유사도(SSIM) 점수를 달성했지만, Claude Fable 5는 경쟁사보다 약 20배 더 비싸다는 것이 밝혀졌으며, 품질에 비례하는 향상을 제공하지 못했습니다. Grok 4.5는 성능이 낮아 종종 사용 가능한 이미지를 생성하지 못했습니다.
그림 그리기 아레나 방법론
연구자들은 빈 흰색 캔버스에서 표준화된 색연필 도구 세트를 사용하여 네 가지 비전 모델—GPT-5.6 Sol, Claude Fable 5, Grok 4.5, 그리고 Gemini 3.6 Flash—을 테스트했습니다. 최종 픽셀 그리드를 생성하는 이미지 생성 모델과 달리, 이러한 모델은 특정 도구 호출을 사용하여 이미지를 반복적으로 구축해야 했습니다:
- Drawing Tools:
draw(배치 마크),set_color,set_brush, 그리고set_pressure(불투명도). - Modification Tools:
smudge(지역 블렌드/부드럽게),erase, 그리고clear_canvas. - Observation Tools:
view_target(참조 이미지)와view_canvas(현재 상태). - Planning: 내부 추론을 위한
plan노-옵 스크래치패드.
모델들은 두 가지 대상 재현(모나리자와 반 고흐의 Starry Night)과 다섯 가지 개방형 텍스트 프롬프트에 과제를 받았습니다. 대상 실행에 대해 구조 유사도 지수(SSIM)와 평균 제곱근 오차(RMSE)로 성능을 측정했으며, 여기에 질적 평가와 비용 분석도 함께 진행되었습니다.
성능 분석: 품질 대 효율
GPT-5.6 Sol: 효율성 리더
GPT-5.6 Sol은 전반적인 품질과 자원 효율성 측면에서 최고 성능을 보였습니다. 특히 set_* 도구를 완전히 우회하고, 대신 각 draw 호출 내에서 색상, 브러시, 압력을 인라인으로 정의했습니다. 이 간소화된 접근 방식은 토큰 사용량과 비용을 크게 낮추어 일곱 개의 그림에 대해 $7.74의 비용을 발생시켰습니다.
Claude Fable 5: 높은 비용, 감소하는 수익
Claude Fable 5는 비용과 출력 사이에 뚜렷한 차이를 보였습니다. 일곱 개의 그림에 대해 약 $160.58의 비용이 들었으며, 이는 GPT-5.6 Sol의 비용의 약 20배에 해당합니다. 이 투자와 도구 호출량 증가(특히 smudge와 view_canvas)에도 불구하고, 품질 면에서 Sol을 능가하지 못했습니다.
Gemini 3.6 Flash: 높은 구조 정확도
Gemini 3.6 Flash는 가장 높은 객관적 SSIM 점수를 달성했으며, 모나리자에 대해 0.449의 최고점을 기록했습니다. 그러나 연구자들은それが 구조적으로 대상에 가깝기는 하지만, 인간 관찰자에게 반드시 가장 미학적으로 pleasing한 모습을 보이지는 않는다고 지적했습니다. 또한 view_canvas 도구를 가장 자주 사용했으며, 그림당 평균 23번의 자체 검토를 수행했습니다.
Grok 4.5: 상당한 능력 격차
Grok 4.5는 이 작업에 어려움을 겪어 종종 사용 불가능하거나 '초현실적'인 결과를 생성했습니다. 매우 비효율적인 도구 호출 패턴을 사용했으며, 호출의 65%가 set_color, set_brush, set_pressure에 할당되어 사용 가능한 시각적 출력 없이 그림당 평균 99단계를 초래했습니다.
반복적 개선에 대한 주요 발견
가장 중요한 발견 중 하나는 모델이 초기에 정체에 도달하고 시간이 지남에 따라 자신의 작업을 종종 악화시킨다는 것입니다.
여덟 번의 대상 재현 실행 모두에서 최종 그림은 모델이 중간에 도달한 최고 버전보다 낮은 점수를 받았습니다. 예를 들어, Gemini 3.6 Flash는 모나리자에서 최고 SSIM 0.449에 도달했으나最終的に 0.337로 마감했습니다. 이는 모델이 '되돌리기' 메커니즘이 부족하여 최고 성능을 넘어 계속 편집한다는 것을 시사하며, 이는 일부 모델이 손상된 요소를 제거하기보다 이전 오류를 수정하기 위해 더 많은 코드를 추가하여 코딩 작업에 접근하는 방식과 유사합니다.
비교 지표 표
| 모델 | 평균 단계 | 평균 시간 | 총 토큰 | 총 비용 | 최종 SSIM (모나리자) | 최고 SSIM (모나리자) |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 29 | 6.2 min | 3.4M | $7.74 | 0.325 | 0.352 |
| Claude Fable 5 | 54 | 12.5 min | 14.6M | $160.58 | 0.286 | 0.289 |
| Grok 4.5 | 99 | 4.8 min | 34.0M | 0.151 | 0.152 | |
| Gemini 3.6 Flash | 73 | 6.9 min | 27.7M | $12.87 | 0.337 | 0.449 |
커뮤니티 통찰 및 비판
기술 관찰자들 사이의 논의에서 테스트의 성격과 관련하여 몇 가지 점이 강조되었습니다:
- Artistic Maturity: 일부 관찰자는 출력이 "어린아이 같은" 모양이라고 지적했는데, 이는 빛, 형태, 굴절에 대한 이해보다는 객체에 대한 개념적 이해(예: "파란색 = 유리))를 반영합니다.
- Inference Innovation: GPT-5.6 Sol의 효율성은 OpenAI의 추론 및 토큰 관리에서의 조용한 혁신을 보여주는 증거로 인용되었습니다.
- Metric Validity: 비판자들은 SSIM/RMSE가 픽셀 기반 지표여서 인간 예술적 판단과 일치하지 않을 수 있다고 주장하며, 시각적 품질과의 정합성을 높이기 위해 DINOv2를 통한 코사인 유사도 사용을 제안했습니다.