OpenAI Sora: 비디오 생성 모델을 세계 시뮬레이터로
OpenAI는 1분 길이의 고품질 비디오를 생성할 수 있는 diffusion transformer 모델인 Sora를 소개했습니다. 이 발전은 비디오 생성 모델을 확장하는 것이 물리적 세계의 범용 시뮬레이터를 구축하는 유망한 경로임을 시사합니다.
시공간 패치를 통한 통합 시각 표현
Sora는 "patches"라 불리는 통합된 시각 데이터 표현을 활용하여 다양한 길이, 해상도 및 종횡비의 비디오와 이미지에 대해 모델을 학습시킬 수 있게 합니다. 이 접근 방식은 다양한 텍스트 모달리티를 통합하기 위해 대형 언어 모델(LLM)에서 사용되는 토큰화에서 영감을 받았습니다.
비디오 압축 네트워크
대규모 학습을 가능하게 하기 위해 OpenAI는 원시 비디오의 차원을 감소시키는 네트워크를 사용하여 공간적·시간적으로 압축된 잠재 표현을 출력합니다. 이후 해당 디코더 모델을 사용해 생성된 잠재값을 픽셀 공간으로 다시 매핑합니다.
시공간 잠재 패치
압축이 완료되면 비디오는 transformer 토큰으로 사용되는 시공간 패치 시퀀스로 분해됩니다. 이미지가 단일 프레임 비디오로 취급되기 때문에 동일한 패치 기반 방식이 이미지에도 적용됩니다. 추론 시에는 원하는 크기의 그리드에 무작위 초기화된 패치를 배치하여 생성되는 비디오의 크기를 제어합니다.
비디오를 위한 Diffusion Transformer 확장
Sora는 diffusion transformer입니다. 텍스트 프롬프트와 같은 정보를 조건으로 하여 입력된 노이즈 패치로부터 원래의 "clean" 패치를 예측하도록 학습됩니다. OpenAI는 diffusion transformer가 비디오 생성에 효과적으로 확장되며, 학습 연산량이 증가함에 따라 샘플 품질이 크게 향상된다는 것을 발견했습니다.
원본 종횡비 학습
이전 모델들은 데이터를 표준 크기(예: 256x256)로 자르거나 크기를 조정했지만, Sora는 원본 크기의 데이터를 사용해 학습됩니다. 이는 두 가지 주요 이점을 제공합니다:
- 샘플링 유연성: Sora는 와이드스크린(1920x1080p), 세로형(1080x1920) 및 중간 종횡비를 원본 그대로 생성할 수 있습니다.
- 구성 개선: 원본 종횡비로 학습하면 피사체가 프레임에서 부분적으로 잘려 나갈 가능성이 줄어들어 전체적인 구도와 구성이 향상됩니다.
언어 이해 및 프롬프트
텍스트 충실도와 비디오 품질을 향상시키기 위해 OpenAI는 DALL·E 3의 재캡션 기법을 적용했습니다. 고도로 서술적인 캡션 모델을 학습시켜 학습 세트에 대한 상세 텍스트 캡션을 생성했습니다. 또한, GPT를 사용해 짧은 사용자 프롬프트를 비디오 모델에 필요한 더 길고 상세한 캡션으로 확장합니다.
다중모달 프롬프트
텍스트-투-비디오를 넘어, Sora는 여러 다른 입력 모달리티를 지원합니다:
- Image-to-Video: Sora는 이미지와 텍스트 프롬프트를 사용해 정적인 이미지를 (DALL·E 2 및 3의 이미지 포함) 애니메이션화할 수 있습니다.
- Video Extension: 모델은 기존 비디오를 시간상 앞으로와 뒤로 확장하여 매끄러운 무한 루프를 만들 수 있습니다.
- Video-to-Video Editing: SDEdit와 같은 기법을 사용해 Sora는 입력 비디오의 스타일과 환경을 제로샷 방식으로 변환할 수 있습니다.
- Video Interpolation: Sora는 두 개의 서로 다른 입력 비디오 사이를 점진적으로 보간하여 매끄러운 전환을 만들 수 있습니다.
- Image Generation: 패치를 시간적 범위가 한 프레임인 공간 그리드에 배치함으로써 Sora는 최대 2048x2048 해상도의 이미지를 생성할 수 있습니다.
등장하는 시뮬레이션 능력
모델을 확장함에 따라 Sora가 3D나 객체에 대한 명시적 귀납적 편향 없이 물리적 및 디지털 세계의 측면을 시뮬레이션할 수 있는 능력이 등장했습니다.
- 3D 일관성: Sora는 동적인 카메라 움직임 중에도 사람과 장면 요소들의 3D 공간 내 움직임을 일관되게 유지합니다.
- 장거리 일관성: 모델은 객체, 동물, 사람을 가려지거나 프레임을 벗어나도 지속시키며, 하나의 샘플 내 여러 샷에 걸쳐 캐릭터 외형을 유지할 수 있습니다.
- 물리적 상호작용: Sora는 화가가 캔버스에 지속적인 붓자국을 남기거나 사람이 버거에 물린 자국을 남기는 등 간단한 상태 변화를 시뮬레이션할 수 있습니다.
- 디지털 세계 시뮬레이션: Sora는 프롬프트에 따라 마인크래프트의 세계와 역학을 고충실도로 렌더링하는 등 인공적인 과정을 시뮬레이션할 수 있습니다.
현재 한계
이러한 등장 능력에도 불구하고 Sora는 아직 완벽한 시뮬레이터가 아닙니다. 유리 파손과 같은 복잡한 상호작용의 물리학을 다루는 데 어려움을 겪으며, 음식 섭취 시 객체 상태 변화를 항상 정확히 반영하지 못합니다. 또한, 일부 장시간 샘플에서는 일관성 결여나 객체가 자발적으로 나타나는 현상이 보입니다.