SANA-WM: 단일 GPU에서 분 단위 월드 모델링 달성

장기 비디오 생성에 대한 탐구는 오랫동안 시각적 충실도와 시간적 일관성 사이의 트레이드오프 문제에 직면해 왔습니다. 대부분의 모델은 몇 초 이상의 일관된 장면을 유지하는 데 어려움을 겪으며, 클립이 진행됨에 따라 종종 "할루시네이션(hallucinations)"이나 기하학적 왜곡이 발생합니다.

NVIDIA의 새로운 오픈 소스 월드 모델인 SANA-WM은 이 장벽을 깨는 것을 목표로 합니다. 2.6B 파라미터의 경량 아키텍처와 하이브리드 어텐션 메커니즘을 결합함으로써, SANA-WM은 단일 GPU에서도 배포 가능한 상태를 유지하면서 720p 해상도의 1분 길이 비디오를 생성할 수 있습니다. 이는 월드 모델링을 거대한 서버 클러스터의 영역에서 접근 가능한 하드웨어의 영역으로 이동시키는 효율성의 중대한 도약입니다.

효율적인 아키텍처

GPU 메모리 부족(OOM) 없이 분 단위의 콘텐츠를 생성할 수 있는 SANA-WM의 능력은 네 가지 주요 아키텍처 혁신에서 비롯됩니다:

1. 하이브리드 선형 어텐션 (Hybrid Linear Attention)

전통적인 softmax attention은 시퀀스 길이에 따라 제곱으로 확장되므로, 60초 비디오를 생성하는 것은 계산적으로 매우 부담스럽습니다. SANA-WM은 Hybrid Linear Attention을 활용하여, 프레임 단위의 Gated DeltaNet과 주기적인 softmax attention을 결합합니다. 이를 통해 모델은 메모리 증가를 억제하면서도 긴 시간 범위에 걸쳐 일관된 "월드 상태"를 유지할 수 있습니다.

2. 이중 브랜치 카메라 제어

비디오가 특정 경로를 따르도록 보장하기 위해, 모델은 6-DoF (six degrees of freedom) 카메라 궤적에 대해 두 가지 접근 방식을 채택합니다:

  • Coarse Global Pose Branch: 일반적인 움직임과 방향을 처리합니다.
  • Fine Pixel-Aligned Geometric Branch: 미터법 카메라 경로에 대한 높은 충실도의 정밀한 일치를 보장합니다.

3. 2단계 생성 파이프라인

시각적 품질은 계층적 프로세스를 통해 더욱 향상됩니다. 초기 2.6B 백본은 긴 롤아웃 생성을 담당하며, 이는 이후 전용 17B long-video refiner로 전달됩니다. 이 두 번째 단계는 텍스처를 선명하게 하고, 움직임의 유연성을 개선하며, 긴 클립의 후반부 윈도우에서 일반적으로 발생하는 품질 저하를 수정합니다.

4. 견고한 어노테이션 파이프라인

고품질의 출력은 고품질의 데이터를 필요로 합니다. 연구팀은 공개 비디오에서 정확한 미터법 규모의 6-DoF 카메라 포즈를 추출하는 파이프라인을 개발하여, 훈련 과정에서 모델에 시공간적으로 일관된 액션 레이블을 제공합니다.

성능 및 배포

SANA-WM의 계산 요구 사항은 산업계의 베이스라인과 비교했을 때 놀라울 정도로 가볍습니다:

  • Training: 모델은 약 213K개의 공개 비디오 클립을 사용하여 64개의 H100 GPU로 15일 동안 훈련되었습니다.
  • Inference: 단일 H100은 1분 길이의 720p 클립을 생성할 수 있습니다.
  • Edge Deployment: NVFP4 양자화를 사용한 증류된 변체(distilled variant)는 단일 RTX 5090에서 60초 길이의 720p 클립의 노이즈를 단 34초 만에 제거할 수 있습니다.

비판적 관점: "월드 모델" vs. 비디오 생성기

기술적 성취는 분명하지만, 이번 발표는 "월드 모델"의 본질에 관한 개발자 및 AI 커뮤니티 사이의 철학적 논쟁을 불러일으켰습니다.

의도성(Intentionality)의 문제

한 가지 주요 비판은 이러한 모델들이 놀라운 시각적 결과물을 만들어내지만, 고사양 비디오 게임에서 볼 수 있는 인간이 설계한 환경과 같은 "의도성"이 부족하다는 점을 시사합니다.

"거의 모든 객체가 의도적으로 배치되어 있습니다... 월드 모델이 이러한 종류의 의도성을 포착하는 단계에 도달하는 것은 상상하기 어렵습니다. 우리가 더 덜 만족스럽고, 덜 인간적인 경험을 더 빠르게 만들 수 있게 된 것일까요?"

일관성 vs. 논리

다른 비판가들은 SANA-WM이 진정한 월드 모델이라기보다는 매우 정교한 비디오 생성기라고 주장합니다. 그들은 "월드"란 단순히 표면적으로 올바르게 보이는 것이 아니라, 물리 법칙이나 생태적 필요에 의해 요소들이 존재하는 내부 논리를 필요로 한다고 주장합니다.

"'월드'를 '월드'로 만드는 것은 바로 그 일관성입니다. 그것은 어떻게 보이는가가 아니라 어떻게 '작동'하는가에 관한 문제입니다... 이러한 '월드'에서는 아무 일도 일어나지 않습니다. 표면적인 일관성은 최소한이고, 논리도 없고, 아무것도 없습니다."

실용적 유용성

미학적 측면을 넘어, 논의되는 가장 즉각적인 실용적 응용 분야는 로보틱스 시뮬레이션입니다. 월드를 "소환"하고 액션의 영향을 상정해 봄으로써, 로봇 시스템은 실제 세계에서 실행하기 전에 생성된 환경에서 움직임을 시뮬레이션하고 테스트할 수 있습니다.

결론

SANA-WM은 적은 파라미터의 모델로 가능한 영역의 경계를 확장하며, 효율적인 어텐션 메커니즘과 다단계 정제 과정을 통해 전문가 수준의 긴 비디오를 생성할 수 있음을 증명합니다. 이것이 "진정한" 월드 모델을 구성하는지에 대한 논쟁은 계속되겠지만, 훈련에는 64개의 GPU를 사용하고 배포에는 단 하나를 사용하는 효율성 이득은 오픈 소스 생성 비디오 분야의 새로운 기준을점을 제시합니다.

Sources