bytedance/vidi

The official repo for "Vidi: Large Multimodal Models for Video Understanding and Editing"

해결하는 문제

Vidi는 포괄적인 비디오 이해 및 생성의 과제를 해결합니다. 정확한 시간적 검색(텍스트 쿼리를 기반으로 비디오 내 특정 시간 범위 찾기), 시공간 그라운딩(특정 시간 범위 내에서 객체 위치 파악)부터 고수준 비디오 분석 및 자동 편집에 이르는 작업을 위한 통합 프레임워크를 제공합니다.

작동 방식

Vidi는 비디오 이해 및 편집(VUE)을 위해 설계된 대규모 멀티모달 모델(LMM) 제품군입니다. 비디오 입력을 처리하여 다음과 같은 여러 작업을 수행합니다:

  • 이해: 검색을 통한 특정 클립 식별, 객체 주변에 경계 상자 그리기(그라운딩), 챕터 제목 생성, 하이라이트 식별, 비디오 콘텐츠에 대한 질문 답변(VQA/Thinking)이 가능합니다.
  • 생성: "Vidi-Edit" 기능을 통해 모델은 여러 업로드된 비디오를 가져와 스토리라인, 음악, 효과가 포함된 편집된 비디오를 자동으로 생성할 수 있습니다.
  • 평가: 이 프로젝트에는 플롯 이해, 시공간 그라운딩, 시간적 검색 성능을 측정하기 위한 여러 벤치마크(VUE-PLOT, VUE-STG, VUE-TR-V2)가 포함되어 있습니다.

대상 사용자

  • AI 연구자: 멀티모달 모델, 비디오 분석 및 자동 비디오 편집을 연구하는 전문가.
  • 개발자: 고급 비디오 검색 및 그라운딩 기능을 애플리케이션에 통합하려는 사용자.
  • 콘텐츠 크리에이터: 비디오 요약, 하이라이트 및 편집을 위한 자동화 도구가 필요한 제작자.

주요 특징

  • 멀티태스크 능력: 그라운딩, 검색, 챕터 생성, 하이라이트 및 VQA 지원.
  • 자동 편집: 원본 클립으로부터 음악과 효과가 포함된 전체 편집 비디오 생성 가능.
  • 포괄적인 벤치마크: 시공간 그라운딩 및 플롯 이해를 위한 전문적인 평가 세트 제공.
  • 모델 가중치: 파인튜닝 코드가 포함된 Vidi-7B 및 Vidi1.5-9B 모델 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch