Atlas: 공간 지능을 위한 월드 모델

World Labs는 "공간 지능"을 달성하기 위해 설계된 차세대 월드 모델인 Atlas를 발표했습니다. Atlas는 텍스트, 이미지, 비디오, 3D 데이터를 원천적으로 처리할 수 있도록 처음부터 사전 훈련된 다중 모달 자동 회귀 확산 트랜스포머입니다. 이러한 입력을 공통된 공간적 맥락으로 통합함으로써, Atlas는 일관된 3D 환경을 생성하고 희소한 이미지에서 실제 세계 장면을 재구성하며, 로봇 공학 및 VFX를 위한 복잡한 시공간 역학을 시뮬레이션할 수 있습니다.

원천적인 공간 제어 및 카메라 기반 생성

Atlas는 정확한 카메라 기하학을 원천적인 입력 유형으로 사용함으로써 픽셀 단위의 카메라 제어를 가능하게 합니다. 이는 사용자가 정확한 카메라 위치와 각도를 지정하여 장면의 새로운 시점을 생성할 수 있도록 합니다.

  • 단일 이미지 외삽: 단일 입력 이미지에서 Atlas는 장면의 나머지를 상상하여 기하학적으로 일관된 상태로 어떤 각도에서든 시점을 생성할 수 있습니다.
  • 공간 맥락 관리: Atlas는 입력을 3D 기반 공간 맥락으로 인코딩합니다. 사용자는 관련 없는 참조 이미지를 3D 공간에 배치할 수 있으며, 모델은 그 사이를 부드럽게 보간하는 세계를 생성하여 복도나 문 같은 전환을 상상할 수 있습니다.
  • 장시간 비디오: 수작업으로 설계된 카메라 경로와 공간 맥락을 결합함으로써, Atlas는 최대 1분 길이의 1440p 해상도에서 일관된 비디오를 생성할 수 있습니다.

고해상도 공간 재구성

Atlas는 희소한 입력에서 새로운 시점 생성이라는 기초 컴퓨터 비전 문제를 해결합니다. 두 세 장의 이미지만으로도 실제 세계 공간을 재구성할 수 있으며, 종종 전용 3D 재구성 모델보다 우수한 성능을 보입니다.

  • 희소에서 밀도로의 재구성: 데이터가 누락된 장면의 간격을 모델이 사전 훈련된 세계 지식을 활용해 채울 수 있습니다. 입력 이미지가 더 많아질수록, 모델은 가능성을 상상하는 것에서 정확하고 충실한 재구성으로 전환됩니다.
  • 명시적인 3D 출력: 2D 프레임을 넘어서 Atlas는 원천적으로 3D 깊이 맵을 생성합니다. 이는 모델이 포인트 클라우드나 3D 가우시안 스플래트 형태로 세계를 출력할 수 있게 하여, 게임, 디자인, VFX 워크플로우에서 재구성된 환경을 활용할 수 있게 합니다.

로봇 공학 및 VFX를 위한 시공간 시뮬레이션

Atlas는 환경이 시간에 따라 어떻게 변화하는지를 모델링하는 월드 시뮬레이터로 작동합니다. 이 능력은 로봇 공학에서 "실제에서 시뮬레이션" 워크플로우에 특히 유용합니다.

  • 로봇 공학 시뮬레이션: Atlas는 스마트폰 비디오에서 공간을 재구성한 후, 로봇의 센서가 그 공간을 탐색할 때 관측할 수 있는 RGB 및 깊이 데이터를 생성할 수 있습니다. 이는 고가의 LiDAR나 특수 캡처 장비 없이도 다양한 로봇 탐색 및 조작 훈련 데이터를 생성할 수 있게 합니다.
  • 비디오 리프레임: Atlas는 몇 개의 일반적인 카메라 시점에서 "버블 타임" 효과를 만들어낼 수 있으며, 세 대의 스마트폰 영상만으로도 불가능한 각도에서 촬영을 정지하고 재구성할 수 있습니다.

기술 아키텍처: 다중 모달 자동 회귀 확산 트랜스포머

Atlas는 표준 LLM 또는 비디오 모델 아키텍처에서 벗어나 공간 제어를 우선시합니다. 그 아키텍처는 네 가지 핵심 특성으로 정의됩니다:

  1. 다중 모달: 텍스트, 이미지, 카메라 자세, 3D 깊이 맵을 원천적으로 처리합니다.
  2. 자동 회귀: 시퀀스의 요소를 하나씩 생성하여, 다양한 작업을 서로 다른 시퀀스 유형으로 간주함으로써 다양한 작업에 적응할 수 있습니다.
  3. 확산: 교정된 흐름 모델로서, 출력을 점진적으로 노이즈 제거하여 추론 속도와 품질 사이의 트레이드오프를 가능하게 합니다.
  4. 트랜스포머: KV 캐싱과 같은 현대 하드웨어 가속과 호환되는 확장성 있는 트랜스포머 백본을 사용합니다.

성능 및 확장성

World Labs는 Atlas가 카메라 조건부 생성과 3D 재구성 모두에서 전용 모델보다 우수한 성능을 보였다고 보고했습니다. 카메라 제어 생성에 대한 인간 평가 시험에서, Atlas는 최근의 비디오 모델보다 뚜렷한 우위를 보였으며, 카메라 궤적이 복잡해질수록 그 차이가 더 두드러졌습니다. 3D 재구성 벤치마크에서는 최고의 전용 오픈소스 재구성 모델보다 낮은 오류율을 달성했습니다.

World Labs는 모델의 성능이 훈련 컴퓨팅 능력이 증가함에 따라 지속적으로 향상된다고 밝혔으며, 확장이 계속해서 능력을 향상시킬 것이라고 예측합니다.

커뮤니티의 통찰과 반론

기술 사용자들 사이의 논의는 현재 월드 모델 접근법의 잠재력과 한계를 동시에 강조하고 있습니다:

"모델이 합성 시점을 생성하는 데 사용할 수 있는 잠재적 지식이 분명히 가치가 있다는 점은 분명합니다... Atlas가 입력 이미지에서 '바닥'처럼 보이는 영역을 식별할 수 있다는 사실은, 모델이 '바닥처럼 걷기 가능한' 개념을 가지고 있을 가능성을 시사합니다. 이는 학습을 통해 얻었을 수 있습니다."

다른 사용자들은 특히 동적 장면에서 시간적 일관성과 환각 현상에 대한 잠재적 문제를 지적했습니다:

"나는 사라지고 나타나는 것들(즉, 일관되지 않은 환각)을 볼 수 있습니다. 도미노가 쓰러지는 장면을 보면, 도미노가 공기 중에 나타나고 사라지는 것이 쉽게 보입니다."

또한 일부 개발자들은 단순한 메시나 스플래트가 아니라 구조화된 장면 프리미티브의 필요성을 언급하며, CAD 응용 프로그램에서는 사용자가 치수를 측정할 수 있는 매개변수 표면이 필요하다고 지적했습니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch