DeepMind, EVE 우주에서 일반화된 게임 에이전트 개발을 위한 Fenris Creations와 협력 발표
TL;DR
DeepMind는 지속 가능한 EVE 온라인 우주에서 작동할 수 있는 일반 목적 AI 에이전트를 개발하기 위해 Fenris Creations와 연구 협력을 발표했다. 이 에이전트는 지속 학습, 장기 기억, 다중 에이전트 계획과 같은 능력을 목표로 하며, 새로운 게임 플레이 경험을 열고 보다 광범위한 AI 연구를 지원할 것으로 기대된다.
게임이 AI 혁신의 촉매제가 되는 이유
DeepMind의 AI 연구는 역사적으로 게임을 실험용 테스트베드로 사용해왔다. 2015년 네이처에 발표된 Deep Q-네트워크(DQN)가 원시 픽셀에서 49개의 아타리 2600 게임을 학습한 것을 시작으로, 랩은 AlphaGo(2016), AlphaGo Zero, AlphaZero, MuZero, AlphaStar에 이르기까지 점점 더 일반화된 강화학습 방법을 보여왔다. 게임에서의 성공은 게임 외 영역에도 직접적으로 기여했으며, 특히 단백질 구조 예측 문제를 해결한 AlphaFold이 게임에서 유도된 기술을 활용해 2024년 화학 노벨상을 수상했다.
게임을 마스터하는 것에서 이해하는 것으로: SIMA 계획
DeepMind의 다음 연구 질문은 AI가 내부 API나 소스 코드에 접근하지 않고도 인간 플레이어처럼 어떤 게임 세계를 이해할 수 있는가이다. 확장 가능한 지시 가능한 다중 세계 에이전트(SIMA) 시리즈는 이를 해결하기 위해 다음과 같은 방식을 채택한다:
- 플레이어가 보는 것과 정확히 동일한 방식으로 게임 화면을 관찰한다.
- 자연어 지시를 해석한다.
- 표준 키보드와 마우스 입력을 통해 게임을 제어한다.
SIMA 2는 전면 모델인 Gemini 시리즈를 기반으로 하며, 노 매인스 스카이, 발하임, 하이드로니어와 같은 3D 환경에서 실시간 추론, 대화, 인간 수준의 플레이를 보여준다. 진정한 일반화된 게임 에이전트는 게임 세계와 NPC를 이해하는 AI 동반자, 스크립트를 넘어서 적응하는 NPC, 지속적인 코드 변경에도 견딜 수 있는 강력한 QA 테스트를 가능하게 할 것이다.
Fenris Creations 협력: 살아있는 실험실
Fenris Creations는 EVE 우주를 만든 독립 스튜디오로, 이러한 능력을 테스트할 수 있는 고유하고 진화하는 사전 환경을 제공한다. EVE 온라인의 지속 가능한 플레이어 주도 경제와 다규모 갈등은 DeepMind의 선도적 AI 목표와 일치하는 네 가지 핵심 도전 과제를 제시한다:
- 지속 학습 – 매일 변화하는 세계에서 기존 지식을 유지하면서 새로운 기술을 습득하는 것.
- 장기 기억 – 현재 모델의 컨텍스트 창보다 훨씬 긴 시간 척도에서 정보를 저장하고 검색하는 것.
- 장기 전망 계획 – 주, 월, 연 단위에 걸쳐 결정을 내리는 것.
- 복잡한 다중 에이전트 역학 – 대규모에서 협력, 경쟁, 협상, 급성 사회적 행동을 다루는 것.
이 협력은 세 가지 EVE 환경을 아우른다:
- EVE Online – 거대 규모의 단일 서버 지속 우주로 은하 전체 전략을 연구하기 위한 장소.
- EVE Vanguard – 1인칭, 빠른 전술 레이어로 지상 전투와 광범위한 우주를 연결한다.
- EVE Frontier – 개방적이고 프로그래머블한 사전 환경으로, ‘스마트 어셈블리’를 통해 세계의 규칙이 진화할 수 있게 하여 에이전트가 새로운 메커니즘에 적응하는 능력을 시험한다.
초기 성과 및 로드맵
협력의 구체적인 성과 중 하나는 Aura Guidance 시스템으로, Gemini를 활용해 EVE 온라인의 신규 조종사에게 커뮤니티가 생성한 도움 콘텐츠를 표시하는 것이다. 연구 로드맵은 단계적으로 진행된다:
- 오프라인 사전 – 초기 에이전트 훈련과 안전 테스트를 위한 EVE 온라인의 안전한 복제본.
- EVE Frontier 실험 – 인간과 공존하는 개방형 환경에서 공동 개발된 에이전트.
- 라이브 통합 – 에이전트가 성숙한 능력을 입증하면, EVE 온라인과 EVE Vanguard에 도입되어 플레이어 경험을 풍부하게 할 수 있다.
AI와 게임에 대한 함의
성공한다면, 이 협력은 다음과 같은 결과를 낳을 수 있다:
- 자연어를 이해하고 과거 상호작용을 기억하며 장기 전망을 계획할 수 있는 AI 동반자.
- 수동 스크립팅 없이 급성 플레이어 행동에 반응하는 동적이고 적응형 NPC.
- 실제 세계의 복잡성에 스케일링 가능한 지속 학습 알고리즘을 위한 테스트베드.
- 지속 가능한 가상 경제에서의 통찰을 금융, 물류, 협업 로봇과 같은 실제 세계 영역에 전이할 수 있다.
결론
DeepMind의 Fenris Creations와의 협력은 AI가 게임을 마스터하는 것에서 복잡하고 지속 가능한 가상 세계와 이해하고 공진화하는 것으로 전략적 전환을 의미한다. EVE 우주 내에서 지속 학습, 장기 기억, 다중 에이전트 역학을 해결함으로써, 이 협력은 혁신적인 게임 플레이 경험을 창출하고 보다 광범위한 과학적 도전 과제에 전이 가능한 AI 지식을 생성하려 한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch