nv-tlabs/Gamma-World

Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

해결하는 문제

Gamma-World는 기존의 인터랙티브 비디오 월드 모델이 주로 단일 에이전트 환경에 집중하는 한계를 해결합니다. 여러 독립적으로 제어 가능한 에이전트(예: 플레이어 또는 로봇)가 공유 공간 내에서 동시에 상호작용하는 환경에서, 시간과 시점 간 일관성을 유지하면서 일관된 미래 프레임을 생성할 수 있습니다.

작동 방식

이 시스템은 여러 에이전트의 동기화된 관측과 행동을 입력으로 사용하는 인과적 다중 에이전트 Diffusion Transformer(DiT)를 사용합니다. 세 가지 핵심 기술적 혁신을 구현합니다:

  1. Simplex Rotary Agent Encoding: 3D RoPE의 파라미터 없는 확장으로, 에이전트를 회전 각도 공간 내 정규 단체의 꼭짓점으로 표현하여, 순서에 관계없이 에이전트를 동등하게 다루되 개별 정체성을 유지합니다.
  2. Sparse Hub Attention: 밀집된 전-전 약속 대신, 학습 가능한 허브 토큰을 사용하여 에이전트 간 통신을 매개하여, 에이전트 수에 비례해 계산 비용을 2차에서 선형으로 감소시킵니다.
  3. 지식 증류(Knowledge Distillation): 전체 컨텍스트를 가진 Diffusion 교사 모델을 인과적 학생 모델로 증류하며, KV 캐싱을 사용해 시간 블록을 순차적으로 생성함으로써 실시간 스트리밍을 가능하게 합니다.

대상 사용자

이 프로젝트는 다중 에이전트 시뮬레이션, 인터랙티브 비디오 생성, 현실 세계의 다중 로봇 조율에 종사하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 실시간 성능: 24 FPS로 행동에 즉각 반응하는 생성이 가능합니다.
  • 제로샷 일반화: 추가 학습 없이 2명에서 4명의 플레이어까지 확장 가능합니다.
  • 확장 가능한 아키텍처: Sparse Hub Attention으로 에이전트 수 증가에 따라 효율성 유지.
  • 다양한 응용 가능성: 가상 게임과 현실 세계 로봇 조율 모두에 적용 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트