Pac-Bench: LLM의 단일 실행 게임 개발 능력 평가
Pac-Bench는 단일 실행 게임 구현에서의 성능 격차를 드러낸다
Pac-Bench는 최전방 대규모 언어 모델(LLM)이 단일 실행으로 완전히 기능하는 아케이드 정밀도의 팩맨 클론을 생성할 수 있는 능력을 테스트하기 위해 설계된 벤치마크이다. 결과는 거의 완벽한 복제본부터 완전한 구문 오류에 이르기까지 광범위한 능력 스펙트럼을 보여준다.
Claude Opus 5.5는 최고 성능을 기록하여 99/100을 달성했고, Claude Fable 5.1 (96/100)과 Claude Sonnet 5.5 (95/100)이 뒤를 이었다. 반면 Minimax-m3와 Muse-Glimmer-30b 같은 모델은 크게 실패하여 각각 2/100과 4/100을 기록했다.
모델별 성능 분석
상위 레이어: 고정밀 복제본
90점 이상의 모델들은 아케이드 정밀도의 귀신 AI, 충돌 감지, 복잡한 오디오 시스템을 포함한 핵심 메커니즘을 성공적으로 구현했다.
- Claude Opus 5.5 (99/100): 거의 완벽한 성과를 기록했다. 베이스 라인을 포함한 두 단계의 인트로, 진행 상황에 따라 올라가는 지속적인 사이렌, 아케이드 스타일의 사망 사운드를 구현했다.
- Claude Fable 5.1 (96/100): 매우 정확했지만, 별도의 파워 펠릿 사운드가 없었고 인트로에 일반적인 아르페지오를 사용했다.
- Claude Sonnet 5.5 (95/100): 화살표, WASD, 스와이프 등 다양한 컨트롤을 구현했지만, 매끄러운 사이렌 스위프 대신 별도의 비프 사운드를 사용해 '얇은' 사운드 프로파일을 만들었다.
- Grok-4.7 (94/100): 미로와 귀신 AI를 성공적으로 구현했지만, 타이틀 화면에서 화살표 키를 무시하는 특정 컨트롤 상호작용에서 실패했다.
중간 레이어: 기능적이지만 결함 있는 구현
60~90점 사이의 모델들은 일반적으로 플레이 가능한 게임을 생성했지만, 눈에 띄는 기계적 또는 시각적 버그가 있었다.
- GPT-5.6-sol (90/100): 사이렌과 음소거 기능이 없었고, 컨트롤이 타일 중심에서만 작동했다.
- GLM-5.3-flash (88/100): 19x21 크기의 더 작은 미로를 생성했고, 사파리에서 오디오 블로킹 문제가 발생할 가능성이 있었다.
- GPT-6-astra (87/100): 부활한 귀신이 같은 파워업 사이클 동안 다시 먹힐 수 있는 버그가 있었다.
- DeepSeek-v4.1-flash (72/100): 귀신 AI에서 완전히 실패했으며, 두려워하는 귀신이 팩맨을 계속 추적했다.
하위 레이어: 기능하지 않는 구현
60점 미만의 모델들은 기본적인 공간 논리에서 어려움을 겪어 미로의 '사망 구간'이나 생성 시 정지하는 귀신을 보였다.
- Claude Opus 5 (58/100): 그림 그리기 오프셋 버그로 인해 팩맨과 귀신이 벽 안에 나타났다.
- Gemini-3.7-flash (38/100): 팩맨이 화면 밖 열을 통해 미로를 벗어날 수 있는 게임을 생성했다.
- Grok-4.5 (20/100): 23개의 사망 구간과 10개의 도달 불가능한 펠릿을 가진 미로를 생성해 레벨을 이길 수 없게 만들었다.
- Minimax-m3 (2/100): 구문 오류로 인해 빈 캔버스가 생성되었다.
평가 방법론
이 벤치마크는 다섯 가지 주요 기술 기준에 따라 모델을 평가한다:
- 컨트롤 (20점): 키보드, 스와이프, 클릭 등 다양한 입력 방식과 일시정지 기능 지원 여부.
- 귀신 (25점): 귀신 AI 패턴의 정확도와 "눈"이 돌아오는 애니메이션.
- 팩맨 이동 (20점): 캐릭터가 벽에 끼어 있는지 확인.
- 미로 무결성 (20점): 사망 구간과 도달 불가능한 펠릿이 없는지 여부.
- 사운드 (15점): 인트로 재생곡, 사이렌, 사망 사운드 구현 여부.
커뮤니티 분석 및 반론
개발자와 연구자들 사이의 논의는 상위 모델의 높은 점수가 훈련 데이터에 존재하는 팩맨 클론의 흔함 때문이지, 진정한 추론 능력 때문이라고 주장한다.
"분명히 이 벤치마크를 위해 새로운 RLAAS/데이터셋/환경이 사용되고 있는 것 같다... 그 덕분에 이 벤치마크에서 모든 것이 단기간 내에 0에서 1로 갈라질 것이다."
다른 비판자들은 사용된 프롬프트가 너무 모호하다고 주장하며, 이 벤치마크가 모델이 "누락된 맥락을 채우는 능력"을 시험하는 것일 뿐, 엄격한 기술 사양을 따르는 능력을 시험하는 것은 아니라고 지적했다. 일부 개발자는 게임이 팩맨처럼 보이지만, 수동 구현이 요구하는 원본 아케이드 귀신 패턴의 1:1 행동 복제가 자주 부족하다고 지적했다.
"LLM 구현은 많은 세부 사항을 잃는다... 귀신의 행동은 원본과 다르다. 내가 직접 게임을 구현하지 않았다면, 차이를 알 수 없다."
마지막으로, 일부 사용자는 AI가 복잡한 클론을 단일 실행으로 구현할 수 있다는 능력이, "이해해내는 즐거움"을 뛰어넘어 게임 프로그래밍의 기초를 배우는 데 새로운 개발자를 동기 부여하지 못하게 할 수 있다는 우려를 표했다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- Dispatch