showlab/Kiwi-Edit

A unified and fully open-source framework for instruction-guided and reference-guided video editing using natural language.

Kiwi‑Edit – 명령 및 참조 가이드 기반 비디오 편집

개요 – Kiwi‑Edit는 자연어 명령(선택적으로 참조 이미지와 함께)을 제공하여 전체 비디오를 편집할 수 있는 오픈 소스 프레임워크입니다. 멀티모달 대규모 언어 모델 (MLLM) 인코더와 비디오 Diffusion Transformer (DiT)를 결합하여 프롬프트를 이해하고 편집된 프레임을 합성합니다.

주요 기능

  • 명령 기반 편집 – 예: "Remove the monkey." 또는 "Apply the dynamic aesthetic of abstract art."
  • 참조 가이드 기반 편집 – 새로운 객체, 스타일 또는 배경을 정의하는 이미지를 제공하여 모델이 비디오 내에 이를 삽입하거나 교체하도록 요청합니다.
  • 다양한 작업을 지원합니다: 스타일 변환, 객체 교체/추가/제거, 배경 교체, 그리고 세밀한 로컬 편집.

시작하기

  1. 환경 설정 (Python 3.10, CUDA 12.8). 이 저장소는 두 개의 준비된 conda 스크립트를 제공합니다 – 전체 학습 스택 (DeepSpeed, FlashAttention)을 위한 install_full_env.sh와 🤗 Diffusers 라이브러리를 사용한 경량 추론을 위한 install_diffusers_env.sh.
  2. 사전 학습된 비디오-DiT를 다운로드 (Wan-AI/Wan2.2-TI2V-5B) hf download를 통해 models/Wan-AI/에 다운로드합니다.
  3. 빠른 데모를 실행합니다:
    python demo.py \
      --ckpt_path path/to/ckpt \
      --video_path ./demo_data/video/source/example.mp4 \
      --prompt "Remove the monkey." \
      --save_path ./output/demo.mp4
    
    Diffusers 사용자는 demo.pydiffusers_demo.py를 사용하고 --model_path를 하나의 발행된 모델 카드로 지정하십시오 (명령 기반, 참조 기반, 또는 결합된 모델).

학습

  • 데이터는 소스 비디오, 타겟 비디오, 선택 사항인 참조 이미지, 그리고 텍스트 프롬프트에 대한 설명이 담긴 CSV 파일로 저장됩니다. 이미지 전용, 비디오 전용, 및 참조 비디오 단계의 데모 CSV가 포함되어 있습니다.
  • 학습 스크립트는 scripts/에 있습니다. 이들은 Qwen2.5-VL-3B 명령 모델과 Wan2.2-TI2V-5B 비디오 백본을 사용하여 3단계 커리큘럼 학습 (이미지 → 이미지+비디오 → 이미지+비디오+참조)을 조율합니다.
  • 이 저장소는 하이퍼파라미터 (해상도, 프레임 수, 학습률, 단계)를 목록화하고 Hugging Face에 결과물인 체크포인트를 제공합니다.

평가

  • 벤치마크: OpenVE-Bench (일반 비디오 편집) 및 RefVIE-Bench (참조 가이드 기반 편집). 다운로드 링크가 제공됩니다; 예상되는 디렉토리 구조는 문서화되어 있습니다.
  • 벤치마크에 대한 추론은 단일 명령 (test_benchmark.py) 후 적절한 평가 스크립트 (eval_openve_gemini.py 또는 eval_refvie_gemini.py)를 따릅니다.

리소스

사용 대상 – 비디오 확산 모델을 연구하는 연구자, AI 기반 비디오 편집 앱을 개발하는 개발자, 그리고 수동으로 프레임별 작업을 하지 않고 프로그래밍 가능한 방식으로 비디오 콘텐츠를 수정하고자 하는 크리에이터.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트