shengshu-ai/Vidu-S

Vidu S: Real-Time Interactive, Editable, and Spatial Video Generation

해결하는 문제

Vidu S는 고해상도 비디오 스트리밍과 관련된 지연 시간 및 안정성 문제를 해결하기 위해 설계된 실시간 대화형 비디오 생성 모음입니다. 고충실도 디지털 캐릭터, 라이브 비디오 편집, 그리고 사용자 지시에 실시간으로 응답할 수 있는 몰입형 공간 비디오 생성을 가능하게 합니다.

작동 방식

이 프로젝트는 두 가지 주요 버전으로 구성됩니다:

  • Vidu S1: 음성 제어 디지털 캐릭터용 모델로, 최대 42 FPS로 540p 비디오를 생성하며 사용자 지정 캐릭터와 음성 톤을 지원합니다.
  • Vidu S2: 720p 대화형 아바타(25–42 FPS) 및 수신 비디오 스트림의 실시간 편집으로 기능을 확장한 고급 버전입니다.

Vidu S2는 Self-Replay Forcing (SRF) 이라는 기술을 사용하여 스트리밍 세그먼트 간 오류 누적을 방지하고 장기적인 안정성을 보장합니다. 성능을 위해 저비트 GEMM 및 멀티 GPU 파이프라이닝을 갖춘 최적화된 서빙 스택(TurboDiffusion 및 TurboServe)을 사용하여 저비용 GPU에서 실행할 수 있습니다.

대상 사용자

디지털 아바타, VR/AR 몰입형 디스플레이, 라이브 비디오 스타일 전환 또는 캐릭터 교체를 위해 실시간 대화형 비디오 생성이 필요한 개발자와 크리에이터.

주요 기능

  • 실시간 대화형 아바타: 춤추기와 같은 큰 신체 동작을 지원하며 25-42 FPS로 720p 비디오를 생성합니다.
  • 라이브 비디오 편집: 동작을 유지하면서 텍스트 지시에 따른 스타일 전환, 가상 착용, 배경/캐릭터 교체를 지원합니다.
  • 공간 비디오: 스트림을 VR 헤드셋용 동기화된 좌우 시점으로 변환합니다.
  • 무한 길이 생성: 안정성 저하 없이 지속적인 실시간 생성이 가능합니다.
  • 효율적인 추론: TurboDiffusion 및 TurboServe를 통해 저비용 GPU에 최적화되었습니다.

관련

  • 프로젝트
  • 프로젝트