showlab/Kiwi-Edit

A unified and fully open-source framework for instruction-guided and reference-guided video editing using natural language.

Kiwi‑Edit – 指令与参考引导的视频编辑

是什么 – Kiwi‑Edit 是一个开源框架,让您可以通过提供自然语言指令(可选与参考图像一起)来编辑整个视频。它结合了多模态大语言模型 (MLLM) 编码器与视频 Diffusion Transformer (DiT) 来理解提示词并合成编辑后的帧。

核心能力

  • 仅指令编辑 – 例如:"Remove the monkey.""Apply the dynamic aesthetic of abstract art."
  • 参考引导编辑 – 提供一张定义新对象、风格或背景的图像,并要求模型将其插入或替换到视频中。
  • 支持一系列操作:风格转移、对象替换/新增/删除、背景替换以及细粒度的局部编辑。

如何开始

  1. 设置环境 (Python 3.10, CUDA 12.8)。该仓库提供了两个现成的 conda 脚本 – install_full_env.sh 用于完整的训练堆栈 (DeepSpeed, FlashAttention) 以及 install_diffusers_env.sh 用于使用 🤗 Diffusers 库进行轻量化推理。
  2. 下载预训练的视频-DiT (Wan-AI/Wan2.2-TI2V-5B) 通过 hf downloadmodels/Wan-AI/
  3. 运行快速演示
    python demo.py \
      --ckpt_path path/to/ckpt \
      --model_path path/to/model
      --video_path ./demo_data/video/source/example.mp4 \
      --prompt "Remove the monkey." \
      --save_path ./output/demo.mp4
    
    对于 Diffusers 用户,请将 demo.py 替换为 diffusers_demo.py 并将 --model_path 指向其中一个发布的模型卡片 (仅指令、仅参考或两者结合)。

训练

  • 数据以 CSV 文件形式存储,描述了源视频、目标视频、可选的参考图像以及文本提示词。包含用于图像仅限、视频仅限以及参考视频阶段的演示 CSV 文件。
  • 训练脚本位于 scripts/。它们使用 Qwen2.5-VL-3B 指令模型搭配 Wan2.2-TI2V-5B 视频骨干网络来协调一个三阶段课程学习 (图像 → 图像+视频 → 图像+视频+参考)。
  • 该仓库列出了超参数 (分辨率, 分辨率, 学习率, 步数) 并提供了指向 Hugging Face 上生成的 checkpoints。

评估

  • 基准测试:OpenVE-Bench (通用视频编辑) 和 RefVIE-Bench (参考引导编辑)。提供了下载链接;并记录了预期的目录结构。
  • 在基准测试上进行推理是单条命令 (test_benchmark.py),随后是适当的评估脚本 (eval_openve_gemini.pyeval_refvie_gemini.py)。

resources

谁可以使用它 – 视频扩散模型研究人员、构建 AI 驱动的视频编辑应用开发者、以及希望以可编程方式修改视频内容而无需手动逐帧编辑的创作者。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目