Jev의 포켓몬스터 레드 플레이 – 실시간 AI 게임플레이 데모 및 커뮤니티 인사이트
요약
AI 기반 의사결정 모델인 Jev는 포켓몬스터 레드 전체를 실시간 스트리밍으로 플레이할 수 있으며, 저렴하고 빠른 동작 선택을 보여주는 동시에 문에서 맴돌거나 최적화되지 않은 전투 선택을 하는 등의 주목할 만한 실패 사례도 드러냅니다.
Jev의 기능
- 실시간 게임플레이: 데모는 기본적으로 오디오가 음소거된 상태로 포켓몬스터 레드를 스트리밍하며, 사용자는 음소거를 해제하여 게임 사운드를 들을 수 있습니다.
- 의사결정 패널: 우측 패널에는 모든 AI 결정과 각 선택에 할당된 확률(odds)이 나열됩니다.
- 가이드 내비게이션: AI는 인간의 공략집과 유사하게 다음에 어디로 가야 할지 알려주는 사전 계산된 가이드를 따릅니다.
- 오픈 소스: 코드는 GitHub(https://github.com/christianmat/jev-pokemon)에서 확인할 수 있으며, 라이브 앱은 https://jev-pokemon.vercel.app/에서 호스팅됩니다.
시스템 작동 방식
- 상태 추출 – 게임 상태는 에뮬레이터 메모리("memhack")에서 읽어오며, 위치, 인벤토리, 전투 상태에 대한 정확한 정보를 제공합니다.
- 의사결정 모델 – 경량 언어 모델(Jev라고 함)이 현재 상태에 대한 텍스트 설명과 가능한 동작 목록(예: "북쪽으로 이동", "메뉴 옵션 선택")을 받습니다.
- 확률 점수 산정 – 모델은 동작에 대한 확률 분포를 반환하며, 가장 높은 확률의 동작이 버튼 입력으로 전송됩니다.
- 가이드 오버레이 – 별도의 가이드 모듈이 상위 수준의 웨이포인트(예: "회색시티로 이동")를 제공하여 동작 범위를 제한하고 목적 없는 방황을 방지합니다.
- 루프 감지 – 시스템은 각 결정을 기록하며, 동일한 상태가 반복되면 모델이 동작을 반복하여 관찰 가능한 루프가 발생할 수 있습니다.
"우측 패널은 모든 결정과 Jev의 확률을 보여줍니다." – 프로젝트 설명
커뮤니티 관찰
강조된 강점
- 속도 및 비용: 댓글 작성자들은 AI의 빠른 결정 속도와 낮은 비용(38시간 플레이에 약 $1.65)에 주목합니다.
- 투명성: 실시간 의사결정 패널을 통해 관찰자는 모델의 신뢰도를 확인할 수 있는데, 이는 많은 AI 게임 데모에서 보기 드문 기능입니다.
- 개념 증명: 게임을 완료(또는 사천왕 도달)함으로써 소형 의사결정 엔진이 전체 RPG 루프를 처리할 수 있음을 입증합니다.
"훌륭한 작업입니다! 게임 전체를 수행하는 것을 보니 정말 멋지네요. 이번 주에 비슷한 것을 만들기 위해 제 fable 예산을 썼지만 웅까지밖에 못 갔습니다." – hummusFiend
약점 및 실패 사례
- 루프 동작: 사용자들은 AI가 로켓단 아지트와 같은 장소에서 몇 분 동안 갇혀 같은 문을 반복해서 여는 현상을 보고했습니다.
- 제한된 선택지: 결정 세트가 가이드에 의해 크게 제한되어 있어, 미리 작성된 경로에서 벗어날 수 없을 때 AI가 "멍청해" 보입니다.
- 최적화되지 않은 전투 전술: AI는 때때로 불꽃 타입 공격 대신 데미지를 주지 않는 카운터 기술을 리자몽에게 가르치는 등 좋지 않은 수를 둡니다.
- 시각 정보 부족: 시스템은 원시 픽셀 입력이 아닌 메모리 읽기에 의존하므로 다른 게임으로의 일반화가 제한됩니다.
"Jev가 이미지를 입력받아서 memhack 없이도 모든 게임에 범용적으로 적용할 수 있었으면 좋겠네요." – avaer
아키텍처 관련 질문
- 캐릭터 이동 제어: "Jev calls" 카운터는 메뉴나 전투 프롬프트에서만 증가하는데, 이는 별도의 스크립트가 저수준 이동을 처리하고 Jev가 고수준 동작을 결정함을 시사합니다.
- 목표 소스: 가이드가 고수준 목표(예: "포켓몬 센터에 도달")를 제공하는 것으로 보이지만, 이러한 목표를 생성하는 정확한 메커니즘은 데모에서 공개되지 않았습니다.
- 더 큰 모델의 가능성: 일부 댓글 작성자들은 Fable과 같은 더 큰 모델이 가이드를 대체하여 고수준 계획과 저수준 실행을 모두 처리할 수 있는지 궁금해합니다.
"gh 저장소의 다이어그램을 보면 이것은 전적으로 Jev인 것 같습니다. Fable과 같은 큰 모델이 고수준 목표를 처리하는 사례가 있나요?" – lwarfield
이것이 중요한 이유
- "시스템 1" AI의 벤치마크: 포켓몬스터 레드와 같은 게임은 시각-텍스트 파이프라인의 지연 시간 없이 빠르고 반사적인 의사결정을 테스트할 수 있는 통제된 환경을 제공합니다.
- 하이브리드 AI 파이프라인: 이 프로젝트는 고수준 플래너(잠재적으로 대형 LLM)를 목표 설정에 사용하고, 경량 의사결정 엔진을 빠른 실행에 사용하는 유망한 분할 방식을 보여줍니다.
- 비용 효율적인 연구: 2달러 미만으로 전체 게임 실행을 시연함으로써 방대한 컴퓨팅 예산 없이도 광범위한 AI 게임플레이 실험을 수행할 수 있음을 보여줍니다.
미해결 질문 및 향후 방향
- 시각 기반 입력: 메모리 해킹을 이미지-텍스트 모델로 대체하면 현대 게임으로의 적용 가능성이 넓어질 수 있습니다.
- 동적 목표 생성: 대형 LLM을 통합하여 즉석에서 목표를 생성하고 조정하면 수작업 가이드에 대한 의존도를 줄일 수 있습니다.
- 루프 완화: 상태 기록 인식이나 강화 학습 스타일의 페널티를 구현하면 끝없는 문 루프를 방지할 수 있습니다.
- 멀티플레이어 고려 사항: 커뮤니티 구성원이 언급했듯이, 온라인 게임에 이러한 에이전트를 배포하면 부정행위 방지 및 공정성 문제가 제기됩니다.
결론: Jev의 실시간 포켓몬스터 레드 플레이는 소형 의사결정 모델이 저비용으로 복잡한 RPG를 탐색할 수 있음을 증명하지만, 이 데모는 또한 고정된 경로와 루프 발생 문제를 해결하기 위해 더 나은 상태 인식, 시각 통합, 고수준 계획이 필요함을 강조합니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch