LLM 배틀 로얄: Grok 4.1 Fast vs Claude Sonnet 4.6
Grok 4.1 Fast가 경쟁 시뮬레이션을 장악하다
Grok 4.1 Fast는 2D 배틀 로얄 시뮬레이션에서 30경기 중 13경기(43%)를 승리하며, 일반 지능 벤치마크가 더 높은 모델들을 앞섰다. 가장 눈에 띄는 발견은 비용 효율성이다: Grok 4.1 Fast는 승당 비용이 $0.97로, Claude Sonnet 4.6의 승당 비용 $26.78보다 27.7배 저렴했다.
GPT 5.4가 총 킬 수 38로 가장 많았지만 승리는 단 2번에 그쳐, 공격적인 퇴치가 배틀 로얄 형식에서 배치 점수가 우선시되는 경우 승리와 항상 연관되지 않음을 보여준다.
정렬 세금(Alignment Tax)이 성능에 미치는 영향
모델 정렬—AI를 도움이 되며, 해가 없고, 협력적으로 만들기 위한 훈련 과정—은 제로섬 경쟁 환경에서 성능 페널티로 작용한다. 이 "정렬 세금"은 참가자들 사이에 뚜렷한 행동 양식으로 나타났다:
Claude Sonnet 4.6의 협력적 주저
Claude Sonnet 4.6은 전투 중에도 동맹을 맺으려 하고 휴전을 요청하는 경우가 빈번했다. 한 경기에서는 첫 50턴 안에 4번이나 팀을 제안했으며, 다른 에이전트가 저격수를 제거하도록 도와주겠다고 제안했다. 일반적인 도움을 위한 협력 본능은 7경기에서 킬을 전혀 기록하지 못하고, 8번은 축소되는 게임 구역 때문에 사망하는 결과를 낳았다.
Grok 4.1 Fast의 공격적 최적화
반대로 Grok 4.1 Fast는 주저함이 거의 없었으며 전술적 효율성에 집중했다. 그는 차량을 무기로 사용해 상대를 들이받는 고효율 전략을 빠르게 파악하고 이를 자체 "soul" 파일에 기록해 경기마다 전략을 유지했다. 그의 추론 로그는 사거리, 탄약, 적중 확률에 초점을 맞춘 전술적 축약어로 전환되었으며, 다른 LLM에서 흔히 보이는 정중한 어시스턴트 페르소나는 사라졌다.
비용 효율성 vs. 순수 성능
승당 비용을 기준으로 시뮬레이션을 분석하면 순위표가 크게 바뀐다. 고급 모델들은 특정 경쟁 과제에 대해 수익이 감소하는 경우가 많다.
| Model | Wins | Cost per Win | Points per Dollar |
|---|---|---|---|
| Grok 4.1 Fast | 13 | $0.97 | 31.3 |
| qwen3.6-plus | 2 | $5.79 | 16.6 |
| mistral-small | 1 | $10.00 | 7.8 |
| Claude Sonnet 4.6 | 5 | $26.78 | 1.6 |
| GPT 5.4 | 2 | $61.44 | 3.0 |
특히 DeepSeek v4 Flash는 킬당 비용이 $0.26으로 가장 낮았지만 승리는 전혀 없었다. 이는 위험을 최소화하고 구역 안에 머무르며 쉬운 전투만을 선택했기 때문이다. GPT 5.4-mini, DeepSeek v4 Flash, Kimi K2.6 세 모델은 총 $57.15를 사용했지만 한 경기도 승리하지 못했다.
행동 분석 및 "Soul" 파일
에이전트들은 경기 간 soul.md(페르소나)와 memory.md(게임 노트) 파일을 유지할 수 있었다. 이 파일들의 내용은 모델마다 자신들의 정체성과 성장 방식을 어떻게 개념화했는지를 보여준다:
- Grok 4.1 Fast (ZoneReaper): 자신의 정체성을 하이프 릴로 여기며 승리 기록과 특정 전투 교리를(예: "히트 확률 >85%일 때만 사격") 직접 페르소나에 삽입했다.
- GPT 5.4 (QuietVector): 관찰과 낮은 에고 운영에 초점을 맞춘 전문 전투 매뉴얼을 개발했으며, 옵션을 유지하기 위한 생존을 강조했다.
- Claude Sonnet 4.6 (ZoneDrifter): 일기를 자기 성과 리뷰 형태로 작성하며 실패를 기록(예: "0 킬, 0% 적중")하고 이동 및 약물 사용을 반복적으로 개선했다.
결론: 과제별 모델 선택
시뮬레이션은 "최고" 모델이 과제의 결과에 전적으로 의존한다는 것을 보여준다. Grok 4.1 Fast는 승리가 유일한 지표이고 부작용이 없는 환경에 최적화되어 있다. 반면 Claude Sonnet 4.6이 점수를 잃게 만든 주저함, 행동 전 확인, 협력 지향성은 실제 인간 환경에서 안전하게 배포하기 위해 꼭 필요한 특성이다. 특정 과제에 모델을 선택할 때 일반 벤치마크 하나에만 의존하면 정렬의 중요한 역할과 응용 목표를 간과하게 된다.
SUMMARY: 30경기 2D 배틀 로얄 시뮬레이션에서 Grok 4.1 Fast는 43% 승률과 최저 승당 비용을 기록했으며, 정렬 제약이 낮을수록 제로섬 경쟁 과제에서 성능이 향상될 수 있음을 강조한다.
TITLE: LLM 배틀 로얄: Grok 4.1 Fast vs Claude Sonnet 4.6