showlab/Kiwi-Edit

A unified and fully open-source framework for instruction-guided and reference-guided video editing using natural language.

Kiwi‑Edit – 指示および参照ガイドによるビデオ編集

概要 – Kiwi‑Editは、自然言語による指示(オプションで参照画像も併用)を与えることで、ビデオ全体を編集できるオープンソースのフレームワークです。マルチモーダル大言語モデル (MLLM) エンコーダとビデオ Diffusion Transformer (DiT) を組み合わせ、プロンプトを理解し、編集後のフレームを合成します。

主な機能

  • 指示のみの編集 – 例:"Remove the monkey." または "Apply the dynamic aesthetic of abstract art."
  • 参照ガイドによる編集 – 新しいオブジェクト、スタイル、または背景を定義する画像を提供し、モデルにビデオ内のそれらを挿入または置換するように指示します。
  • 幅広い操作をサポート:スタイル転移、オブジェクトの置換/追加/追加/削除、背景の置換、およびきめ細かなローカル編集。

はじめに

  1. 環境構築 (Python 3.10, CUDA 12.8)。本リポジトリは、準備済みの conda 脚本を2つ提供しています。完全なトレーニング・スタック (DeepSpeed, FlashAttention) 用の install_full_env.sh と、🤗 Diffusers ライブラリを使用した軽量な推論用の install_diffusers_env.sh
  2. 学習済みビデオ-DiTをダウンロード (Wan-AI/Wan2.2-TI2V-5B) を hf download を使用して models/Wan-AI/ にダウンロードします。
  3. クイックデモを動かす
    python demo.py \
      --ckpt_path path/to/ckpt \
      --video_path ./demo_data/video/source/example.mp4 \
      --prompt "Remove the monkey." \
      --save_path ./output/demo.mp4
    
    Diffusers ユーザーは、demo.pydiffusers_demo.py に置き換え、--model_path をいずれかの公開されたモデルカード (指示のみ、参照のみ、または組み合わせ) に指定してください。

トレーニング

  • データは、ソースビデオ、ターゲットビデオ、オプションの参照画像、およびテキストプロンプトを記述する CSV ファイルとして保存されています。画像のみ、ビデオのみ、および参照ビデオ段階のデモ用 CSV が含まれています。
  • トレーニング・スクリプトは scripts/ にあります。これらは、Qwen2.5-VL-3B 指示モデルと Wan2.2-TI2V-5B ビデオ・バックボーンを併用し、三段階のカリキュラム学習 (画像 → 画像+ビデオ → 画像+ビデオ+参照) をオーケストレートします。
  • 本リポジトリはハイパーパラメータ (解像度, 分解能, 学習率, ステップ数) をリストアップし、Hugging Face 上の学習済みチェックポイントへのリンクを提供します。

評価

  • ベンチマーク:OpenVE-Bench (一般的なビデオ編集) および RefVIE-Bench (参照ガイドによる編集)。ダウンロードリンクが提供されています。期待されるディレクトリ構造はドキュメント化されています。
  • ベンチマークでの推論は、単一のコマンド (test_benchmark.py) と、それに続く適切な評価スクリプト (eval_openve_gemini.py または eval_refvie_gemini.py) で行います。

リソース

対象ユーザー – ビデオ拡散モデルを研究している研究者、AI 駆動のビデオ編集アプリを開発している開発者、および手動でのフレームごとの作業なしにビデオ内容をプログラム可能な方法で変更したいクリエイター。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト