브루드 워 벤치: LLM이 스타크래프트 II를 플레이한다 – 코드크스 아스트라가 선두, 모든 모델은 초보 수준

핵심 요약

코드크스 아스트라 (xhigh)는 완벽한 100% 승률을 기록했지만, 벤치마크에 등장한 모든 LLM은 장기적인 전략을 실행하거나 간단한 공격에 대응하는 능력이 부족해 초보 수준에 머물렀다.


벤치마크 개요

"브루드 워 벤치" 벤치마크는 대규모 언어 모델(LLM)이 직접 게임 명령을 내리는 커스텀 스타크래프트 II: 브루드 워 환경에서 서로 경쟁하도록 설계되었다. 각 모델은 여러 노력 수준(low, medium, xhigh)에서 실행되어 승률, 분당 행동 수(APM), 게임당 비용을 측정한다.

리더보드 요약

순위 모델 / 노력 수준 승리 패배 APM 게임당 비용 승률
🥇 코드크스 아스트라 / xhigh 18 0 12.6 $10.54 100 %
🥈 코드크스 아스트라 / medium 16 2 17.2 $15.11 88.9 %
🥉 클로드 펠브 15 3 12.6 $12.24 83.3 %
4 코드크스 아스트라 / low 14 4 25.7 $21.07 77.8 %
5 코드크스 5.6 솔 / medium 13 5 10.1 $5.12 72.2 %

상위 3개는 모두 오픈AI의 코드크스 계열이며, 클로드 펠브는 상위 5위 안에 든 유일한 비-코드크스 모델이다.


모델의 행동 양상

코드크스 아스트라 – 공격적 방해, 약한 마크로

"코드크스의 가장 강력한 반복적인 아이디어는 방해였다. 자주 프로브를 맵 전체를 가로질러 보내 작업자나 건물을 공격해 상대방이 시간을 낭비하게 만들었다." – 벤 스웨르드로프

  • 치즈 전술 – 조기 프로브와 단일 유닛 강습이 반복적으로 상대방을 놀라게 했다.
  • 분산된 하위 에이전트 – 경제, 생산, 전투를 별개의 에이전트가 담당했지만 조율이 부족해 조각난 공격을 했다.
  • 초보자의 실수 – 유닛을 하나씩 차례로 출동시켜 비상한 집결을 기다리지 않아 군대의 효과를 제한했다.
  • 지속성 – 패배한 경우에도 코드크스 5.6 테라가 지휘소를 옮기고 6분 더 생존하며 즉각적인 패배를 피할 수 있는 능력을 보였다.

클로드 펠브 – 야심 찬데 완성되지 않음

"펠브는 첫 번째 유닛을 만든 후 멈추기보다 경제를 구축하고 기술 트리에 오르려는 경향이 있었다." – 벤 스웨르드로프

  • 장기적 계획 – 고급 기술(레이, 스피어, 머털리스크; 로보틱스 시설, 템플러 아카이브)을 구축했고 때때로 승리했다.
  • 실행 격차 – 강력한 기술을 갖추었음에도 불구하고 업그레이드를 결정적인 군대로 전환하지 못했다(예: 팩토리와 아카데미에 도달했지만 오퍼스 5에 의해 침략당함).

그록 4.6 – 너무 많은 생각, 너무 적은 행동

"그록 4.6은 자주 긴 논리적 추론을 하고 매우 적은 명령 배치를 내보냈다. 43분 동안의 한 게임에서 단 6번의 명령 배치만을 내보냈다." – 벤 스웨르드로프

  • 낮은 APM – 평균 11 APM을 기록했고, 전투 유닛을 거의 배치하지 않았다.
  • 턴 기반 착각 – 모델이 게임이 정지된 것처럼 추론을 하며 의미 있는 전투를 하지 못했다.

정량적 발견

지표 코드크스 아스트라 (xhigh) 클로드 펠브 그록 4.6
평균 APM 12.6 12.6 11.1
평균 군대 규모 (유닛 수) 8.3 7.6 2.0
평균 구조물 수 6.2 7.4 4.5
미사용 광물 240.6 248.6 536.6
승률 100 % 83.3 % 0 %

모든 모델이 자원의 상당 부분을 비활성 상태로 두었으며, 특히 그록은 평균적으로 50만 광물을 미사용했다.


헤드투헤드 매트릭스 통찰

전체 19×19 매트릭스(소스 링크 참조)는 다음과 같은 사실을 보여준다:

  • 코드크스 아스트라 (xhigh)는 다른 모든 구성에 대해 승리한다.
  • 비-코드크스 모델 중 가장 강력한 클로드 펠브도 코드크스 아스트라의 두 노력 수준 모두에서 패배한다.
  • 그록은 한 번도 승리하지 못했으며, 최고 성적은 시간 제한 무승부였다.
  • 클로드 오퍼스 5와 클로드 손넷은 낮은 노력 수준의 코드크스 변형에만 비교적 높은 승률을 기록한다.

커뮤니티 반응

"2010년, bwapi 초기 시절에 브루드 워 AI 대회가 있었다… 당시의 접근 방식과 지금이나 딥마인드의 SC2 연구와 비교해보는 것은 흥미롭다." – @AntiRush

"이런 것들이 유용하려면 너무 오래 생각하는 경향이 있다" – @xyzsparetimexyz

"아이즈 오브 엠파이어즈 2용 벤치마크를 만들고 싶지만, AI가 어떻게 플레이하게 할지 전혀 모르겠다." – @windowshopping

"아스트라는 명시적으로 미디엄/xhigh 수준이 있었고, 펠브는 그냥 펠브였다. 어떤 추론 수준이 사용되었는가?" – @leobuskin

댓글들은 고전적인 스타크래프트 AI 대회에 대한 애정을 드러내며, 실시간 vs 턴 기반 환경의 본질에 대한 호기심과, 다른 RTS나 전략 게임으로 벤치마크를 확장할 수 있다는 제안을 담고 있다.


벤치마크 실행 방식

  • 라운드 로빈 매트릭스를 통해 모든 모델-노력 수준 구성이 서로 대결했다.
  • 게임은 프리스타일 VM에서 병렬로 실행되었다.
  • 각 게임마다 게임 엔진 상태와 에이전트 로그가 기록되었다.
  • 비용은 각 모델의 토큰 기반 가격(예: 오픈AI 토큰 가격, 클로드 토큰 가격)을 사용해 계산되었다.

함의 및 미래 방향성

  • 실시간 추론은 여전히 한계점이다. 최고 성능을 보인 LLM(코드크스 아스트라)도 정교한 마크로 관리 대신 저렴한 방해 전술에 의존한다.
  • 비용-성능 트레이드오프가 명확하다. 높은 노력 수준은 승률을 높이지만 게임당 비용도 증가한다. 일부 낮은 노력 수준 설정(예: 코드크스 5.6 솔 / low)은 비용의 일부만으로도 존경할 만한 승률을 기록한다.
  • 벤치마크 확장성. 커뮤니티의 관심은 같은 프레임워크를 다른 RTS 타이틀(아이즈 오브 엠파이어즈 II, 스타크래프트 II 리마스터)이나 체스(GoBench 참조)와 같은 턴 기반 전략 게임에 적용할 수 있음을 시사한다.
  • 모델 아키텍처의 중요성. 코드크스에서 관찰된 분할-하위-에이전트 패턴은 아키텍처적 개선 가능성을 시사한다: 공유된 상태 또는 조율 레이어를 도입하면 "한 번에 하나의 유닛"이라는 약점을 완화할 수 있다.

직접 매치를 플레이해보세요

이 벤치마크는 공개되어 있으며, 사용자는 자신의 에이전트를 가져와 공개된 모델들과 대결할 수 있습니다:

브루드 워 플레이하기

Sources

관련