텍스트-비디오 모델 탐구

텍스트-비디오 생성은 텍스트 설명으로부터 이미지 시퀀스를 만들어내면서 공간적·시간적 일관성을 유지하는 신흥 컴퓨터 비전 과제입니다. 텍스트-이미지 생성과 유사한 진화 경로를 따르지만, 프레임 간 장기 의존성을 요구하기 때문에 훨씬 더 복잡합니다.

텍스트-비디오 생성의 과제

텍스트만으로 비디오를 생성하는 것은 정적인 이미지를 만드는 것보다 더 어렵습니다. 이는 시간에 걸친 일관성을 유지해야 하기 때문입니다. 주요 장애물은 다음과 같습니다:

  • 계산 비용: 프레임 간 시간적·공간적 일관성을 보장하려면 장기 의존성이 발생해 학습 비용이 크게 늘어나며, 많은 연구자에게는 감당하기 어려운 수준이 됩니다.
  • 데이터 부족: 고품질의 멀티모달 데이터셋, 즉 비디오와 텍스트가 짝을 이룬 데이터는 매우 드물고 주석도 빈약한 경우가 많아 모델이 복잡한 움직임 의미를 학습하기 어렵습니다.
  • 캡션 모호성: 비디오를 설명하는 것은 단일 이미지를 설명하는 것보다 복잡합니다. 효과적인 비디오 생성은 하나의 짧은 텍스트 프롬프트가 아니라 일련의 프롬프트나 서사적 이야기가 필요합니다.

모델 아키텍처의 진화

텍스트-비디오 모델은 크게 세 가지 아키텍처 흐름을 거쳐 발전해 왔습니다:

1. GAN 및 VAE 기반 접근법

초기 연구에서는 생성적 적대 신경망(GANs)과 변분 오토인코더(VAEs)를 활용해 캡션을 기반으로 프레임을 자동 회귀적으로 생성했습니다. 예시로 Text2FilterTGANs-C가 있습니다. 이러한 초기 모델은 낮은 해상도, 짧은 길이, 단순하고 독립적인 움직임에 제한되었습니다.

2. 트랜스포머 기반 프레임워크

GPT‑3와 DALL‑E의 성공에 힘입어 연구자들은 더 긴 시퀀스를 처리할 수 있는 트랜스포머 아키텍처를 도입했습니다. 주요 모델은 다음과 같습니다:

  • Phenaki: 프롬프트 시퀀스(스토리라인)를 조건으로 하여 임의 길이의 비디오를 생성합니다.
  • NUWA‑Infinity: 자동 회귀‑오버‑자동 회귀 메커니즘을 사용해 무한히 긴 HD 품질 비디오를 합성합니다.
  • Other frameworks: CogVideo, VideoGPT, Make‑A‑Video도 트랜스포머 기반 접근을 활용하며, TATS는 VQGAN과 시간 민감 트랜스포머 모듈을 결합합니다.

3. 확산 기반 아키텍처

현재 연구 흐름은 확산 모델을 활용해 초현실적이며 맥락이 풍부한 결과를 목표로 합니다. 주요 발전은 다음과 같습니다:

  • Video Diffusion Models (VDM): 비디오 영역에 확산 모델을 최초로 적용한 선구자입니다.
  • MagicVideo: VDM보다 효율성을 높이기 위해 저차원 잠재 공간에서 비디오 클립을 생성합니다.
  • Text2Video‑Zero: 사전 학습된 Stable Diffusion 모델에 학습 가능한 움직임 역학 모듈을 결합한 제로샷 프레임워크로, 텍스트‑비디오 짝 데이터가 전혀 필요 없습니다.
  • NUWA‑XL: "diffusion over diffusion" 방식을 사용해 3,376 프레임으로 학습함으로써 슬라이딩‑윈도우 자동 회귀 생성에서 발생하는 컨텍스트 격차를 감소시킵니다.
  • Tune‑a‑Video: 단일 텍스트‑비디오 쌍을 이용해 사전 학습된 텍스트‑이미지 모델을 미세 조정해 내용은 바꾸고 움직임은 유지합니다.

비디오-텍스트 데이터셋

모델 성능은 짝을 이룬 비디오‑텍스트 데이터셋의 품질에 크게 좌우됩니다. 현재 전략은 대규모 데이터셋을 활용하거나 서로 다른 데이터 유형을 결합하는 것입니다:

  • WebVid: 10.7 백만 개의 텍스트‑비디오 쌍(52 천시간 비디오)으로 구성된 일반 데이터셋이지만, 노이즈와 무관한 설명이 많이 포함돼 있습니다.
  • Howto100M: 요리, 원예 등 단계별 교육 비디오에 초점을 맞추며 1.36 억 개의 클립을 제공합니다.
  • QuerYD: 사건 위치 지정에 중점을 두어 객체와 행동의 상대 위치에 대한 상세 캡션을 제공합니다.
  • CelebV‑Text: 70 천 개 이상의 비디오를 보유한 대규모 얼굴 데이터셋으로, 사실적인 얼굴, 감정, 제스처 생성에 활용됩니다.

Make‑a‑Video와 같은 일부 모델은 텍스트‑이미지 쌍을 이용해 시각적 외관을 학습하고, 단일 모달 비디오 데이터를 활용해 공간‑시간 의존성을 비지도 방식으로 학습함으로써 데이터 부족 문제를 우회하려고 시도합니다.

구현 및 오픈 소스 리소스

많은 텍스트‑비디오 모델이 diffusers 라이브러리를 통해 Hugging Face 생태계에 통합되었습니다. 사용자는 Text2Video‑ZeroModelScope(Alibaba / DAMO Vision Intelligence Lab)와 같은 모델을 실행하고 미세 조정할 수 있습니다.

실용적인 적용

사용자는 다음 구현 패턴을 사용해 ModelScope 모델을 배포할 수 있습니다:

import torch
from diffusers import DiffusionPipeline, DPMSolverMultistepScheduler
from diffusers.utils import export_to_video

pipe = DiffusionPipeline.from_pretrained("damo-vilab/text-to-video-ms-1.7b", torch_dtype=torch.float16, variant="fp16")
pipe.scheduler = DPMSolverMultistepScheduler.from_config(pipe.scheduler.config)
pipe.enable_model_cpu_offload()

prompt = "Spiderman is surfing"
video_frames = pipe(prompt, num_inference_steps=25).frames
video_path = export_to_video(video_frames)

커뮤니티 생태계

공식 통합 외에도 커뮤니티는 Phil Wang(lucidrains) 등 기여자를 통해 Imagen, Phenaki, NUWA 등 주요 논문의 비공식 구현을 개발했으며, ExponentialML이 제공하는 미세 조정 프레임워크 등도 활발히 사용되고 있습니다.

Sources