showlab/Kiwi-Edit
A unified and fully open-source framework for instruction-guided and reference-guided video editing using natural language.
Kiwi‑Edit – 指令与参考引导的视频编辑
是什么 – Kiwi‑Edit 是一个开源框架,让您可以通过提供自然语言指令(可选与参考图像一起)来编辑整个视频。它结合了多模态大语言模型 (MLLM) 编码器与视频 Diffusion Transformer (DiT) 来理解提示词并合成编辑后的帧。
核心能力
- 仅指令编辑 – 例如:"Remove the monkey." 或 "Apply the dynamic aesthetic of abstract art."
- 参考引导编辑 – 提供一张定义新对象、风格或背景的图像,并要求模型将其插入或替换到视频中。
- 支持一系列操作:风格转移、对象替换/新增/删除、背景替换以及细粒度的局部编辑。
如何开始
- 设置环境 (Python 3.10, CUDA 12.8)。该仓库提供了两个现成的 conda 脚本 –
install_full_env.sh用于完整的训练堆栈 (DeepSpeed, FlashAttention) 以及install_diffusers_env.sh用于使用 🤗 Diffusers 库进行轻量化推理。 - 下载预训练的视频-DiT (Wan-AI/Wan2.2-TI2V-5B) 通过
hf download到models/Wan-AI/。 - 运行快速演示:
对于 Diffusers 用户,请将python demo.py \ --ckpt_path path/to/ckpt \ --model_path path/to/model --video_path ./demo_data/video/source/example.mp4 \ --prompt "Remove the monkey." \ --save_path ./output/demo.mp4demo.py替换为diffusers_demo.py并将--model_path指向其中一个发布的模型卡片 (仅指令、仅参考或两者结合)。
训练
- 数据以 CSV 文件形式存储,描述了源视频、目标视频、可选的参考图像以及文本提示词。包含用于图像仅限、视频仅限以及参考视频阶段的演示 CSV 文件。
- 训练脚本位于
scripts/。它们使用 Qwen2.5-VL-3B 指令模型搭配 Wan2.2-TI2V-5B 视频骨干网络来协调一个三阶段课程学习 (图像 → 图像+视频 → 图像+视频+参考)。 - 该仓库列出了超参数 (分辨率, 分辨率, 学习率, 步数) 并提供了指向 Hugging Face 上生成的 checkpoints。
评估
- 基准测试:OpenVE-Bench (通用视频编辑) 和 RefVIE-Bench (参考引导编辑)。提供了下载链接;并记录了预期的目录结构。
- 在基准测试上进行推理是单条命令 (
test_benchmark.py),随后是适当的评估脚本 (eval_openve_gemini.py或eval_refvie_gemini.py)。
resources
- 项目页面 & 论文:https://showlab.github.io/Kiwi-Edit, https://arxiv.org/abs/2603.02175
- 模型中心 (🤗 Hugging Face):针对不同训练方案的不同 Diffusers checkpoints。
- 演示空间:https://huggingface.co/spaces/linyq/KiwiEdit
- 致谢数据集与工具:Ditto-1M, OpenVE-3M, ReCo, GPT-Image-Edit-1.5M, EditScore, Qwen2.5-VL, Wan-Video, 等。
谁可以使用它 – 视频扩散模型研究人员、构建 AI 驱动的视频编辑应用开发者、以及希望以可编程方式修改视频内容而无需手动逐帧编辑的创作者。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目