브루드 워 벤치: LLM이 스타크래프트 II를 플레이한다 – 코드크스 아스트라가 선두, 모든 모델은 초보 수준
핵심 요약
코드크스 아스트라 (xhigh)는 완벽한 100% 승률을 기록했지만, 벤치마크에 등장한 모든 LLM은 장기적인 전략을 실행하거나 간단한 공격에 대응하는 능력이 부족해 초보 수준에 머물렀다.
벤치마크 개요
"브루드 워 벤치" 벤치마크는 대규모 언어 모델(LLM)이 직접 게임 명령을 내리는 커스텀 스타크래프트 II: 브루드 워 환경에서 서로 경쟁하도록 설계되었다. 각 모델은 여러 노력 수준(low, medium, xhigh)에서 실행되어 승률, 분당 행동 수(APM), 게임당 비용을 측정한다.
리더보드 요약
| 순위 | 모델 / 노력 수준 | 승리 | 패배 | APM | 게임당 비용 | 승률 |
|---|---|---|---|---|---|---|
| 🥇 | 코드크스 아스트라 / xhigh | 18 | 0 | 12.6 | $10.54 | 100 % |
| 🥈 | 코드크스 아스트라 / medium | 16 | 2 | 17.2 | $15.11 | 88.9 % |
| 🥉 | 클로드 펠브 | 15 | 3 | 12.6 | $12.24 | 83.3 % |
| 4 | 코드크스 아스트라 / low | 14 | 4 | 25.7 | $21.07 | 77.8 % |
| 5 | 코드크스 5.6 솔 / medium | 13 | 5 | 10.1 | $5.12 | 72.2 % |
| … | … | … | … | … | … | … |
상위 3개는 모두 오픈AI의 코드크스 계열이며, 클로드 펠브는 상위 5위 안에 든 유일한 비-코드크스 모델이다.
모델의 행동 양상
코드크스 아스트라 – 공격적 방해, 약한 마크로
"코드크스의 가장 강력한 반복적인 아이디어는 방해였다. 자주 프로브를 맵 전체를 가로질러 보내 작업자나 건물을 공격해 상대방이 시간을 낭비하게 만들었다." – 벤 스웨르드로프
- 치즈 전술 – 조기 프로브와 단일 유닛 강습이 반복적으로 상대방을 놀라게 했다.
- 분산된 하위 에이전트 – 경제, 생산, 전투를 별개의 에이전트가 담당했지만 조율이 부족해 조각난 공격을 했다.
- 초보자의 실수 – 유닛을 하나씩 차례로 출동시켜 비상한 집결을 기다리지 않아 군대의 효과를 제한했다.
- 지속성 – 패배한 경우에도 코드크스 5.6 테라가 지휘소를 옮기고 6분 더 생존하며 즉각적인 패배를 피할 수 있는 능력을 보였다.
클로드 펠브 – 야심 찬데 완성되지 않음
"펠브는 첫 번째 유닛을 만든 후 멈추기보다 경제를 구축하고 기술 트리에 오르려는 경향이 있었다." – 벤 스웨르드로프
- 장기적 계획 – 고급 기술(레이, 스피어, 머털리스크; 로보틱스 시설, 템플러 아카이브)을 구축했고 때때로 승리했다.
- 실행 격차 – 강력한 기술을 갖추었음에도 불구하고 업그레이드를 결정적인 군대로 전환하지 못했다(예: 팩토리와 아카데미에 도달했지만 오퍼스 5에 의해 침략당함).
그록 4.6 – 너무 많은 생각, 너무 적은 행동
"그록 4.6은 자주 긴 논리적 추론을 하고 매우 적은 명령 배치를 내보냈다. 43분 동안의 한 게임에서 단 6번의 명령 배치만을 내보냈다." – 벤 스웨르드로프
- 낮은 APM – 평균 11 APM을 기록했고, 전투 유닛을 거의 배치하지 않았다.
- 턴 기반 착각 – 모델이 게임이 정지된 것처럼 추론을 하며 의미 있는 전투를 하지 못했다.
정량적 발견
| 지표 | 코드크스 아스트라 (xhigh) | 클로드 펠브 | 그록 4.6 |
|---|---|---|---|
| 평균 APM | 12.6 | 12.6 | 11.1 |
| 평균 군대 규모 (유닛 수) | 8.3 | 7.6 | 2.0 |
| 평균 구조물 수 | 6.2 | 7.4 | 4.5 |
| 미사용 광물 | 240.6 | 248.6 | 536.6 |
| 승률 | 100 % | 83.3 % | 0 % |
모든 모델이 자원의 상당 부분을 비활성 상태로 두었으며, 특히 그록은 평균적으로 50만 광물을 미사용했다.
헤드투헤드 매트릭스 통찰
전체 19×19 매트릭스(소스 링크 참조)는 다음과 같은 사실을 보여준다:
- 코드크스 아스트라 (xhigh)는 다른 모든 구성에 대해 승리한다.
- 비-코드크스 모델 중 가장 강력한 클로드 펠브도 코드크스 아스트라의 두 노력 수준 모두에서 패배한다.
- 그록은 한 번도 승리하지 못했으며, 최고 성적은 시간 제한 무승부였다.
- 클로드 오퍼스 5와 클로드 손넷은 낮은 노력 수준의 코드크스 변형에만 비교적 높은 승률을 기록한다.
커뮤니티 반응
"2010년, bwapi 초기 시절에 브루드 워 AI 대회가 있었다… 당시의 접근 방식과 지금이나 딥마인드의 SC2 연구와 비교해보는 것은 흥미롭다." – @AntiRush
"이런 것들이 유용하려면 너무 오래 생각하는 경향이 있다" – @xyzsparetimexyz
"아이즈 오브 엠파이어즈 2용 벤치마크를 만들고 싶지만, AI가 어떻게 플레이하게 할지 전혀 모르겠다." – @windowshopping
"아스트라는 명시적으로 미디엄/xhigh 수준이 있었고, 펠브는 그냥 펠브였다. 어떤 추론 수준이 사용되었는가?" – @leobuskin
댓글들은 고전적인 스타크래프트 AI 대회에 대한 애정을 드러내며, 실시간 vs 턴 기반 환경의 본질에 대한 호기심과, 다른 RTS나 전략 게임으로 벤치마크를 확장할 수 있다는 제안을 담고 있다.
벤치마크 실행 방식
- 라운드 로빈 매트릭스를 통해 모든 모델-노력 수준 구성이 서로 대결했다.
- 게임은 프리스타일 VM에서 병렬로 실행되었다.
- 각 게임마다 게임 엔진 상태와 에이전트 로그가 기록되었다.
- 비용은 각 모델의 토큰 기반 가격(예: 오픈AI 토큰 가격, 클로드 토큰 가격)을 사용해 계산되었다.
함의 및 미래 방향성
- 실시간 추론은 여전히 한계점이다. 최고 성능을 보인 LLM(코드크스 아스트라)도 정교한 마크로 관리 대신 저렴한 방해 전술에 의존한다.
- 비용-성능 트레이드오프가 명확하다. 높은 노력 수준은 승률을 높이지만 게임당 비용도 증가한다. 일부 낮은 노력 수준 설정(예: 코드크스 5.6 솔 / low)은 비용의 일부만으로도 존경할 만한 승률을 기록한다.
- 벤치마크 확장성. 커뮤니티의 관심은 같은 프레임워크를 다른 RTS 타이틀(아이즈 오브 엠파이어즈 II, 스타크래프트 II 리마스터)이나 체스(GoBench 참조)와 같은 턴 기반 전략 게임에 적용할 수 있음을 시사한다.
- 모델 아키텍처의 중요성. 코드크스에서 관찰된 분할-하위-에이전트 패턴은 아키텍처적 개선 가능성을 시사한다: 공유된 상태 또는 조율 레이어를 도입하면 "한 번에 하나의 유닛"이라는 약점을 완화할 수 있다.
직접 매치를 플레이해보세요
이 벤치마크는 공개되어 있으며, 사용자는 자신의 에이전트를 가져와 공개된 모델들과 대결할 수 있습니다:
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch