showlab/Kiwi-Edit
A unified and fully open-source framework for instruction-guided and reference-guided video editing using natural language.
Kiwi‑Edit – 指令與參考引導的影片編輯
是什麼 – Kiwi‑Edit 是一個開源框架,讓您能透過提供自然語言指令(可選擇搭配參考圖像)來編輯整個影片。它結合了多模態大型語言模型 (MLLM) 編碼器與影片 Diffusion Transformer (DiT) 來理解提示詞並合成編輯後的影格幀。
核心能力
- 僅指令編輯 – 例如:"Remove the monkey." 或 "Apply the dynamic aesthetic of abstract art."
- 參考引導編輯 – 提供一張定義新物件、風格或背景的圖像,並要求模型將其插入或替換到影片中。
- 支持一系列操作:風格轉移、物件替換/新增/移除、背景替換以及細粒度的局部編輯。
如何開始
- 設置環境 (Python 3.10, CUDA 12.8)。該儲存庫提供了兩個現成的 conda 腳本 –
install_full_env.sh用於完整的訓練堆疊 (DeepSpeed, FlashAttention) 以及install_diffusers_env.sh用於使用 🤗 Diffusers 函式庫進行輕量化推理。 - 下載預訓練的影片-DiT (Wan-AI/Wan2.2-TI2V-5B) 透過
hf download到models/Wan-AI/。 - 運行快速演示:
對於 Diffusers 用戶,請將python demo.py \ --ckpt_path path/to/ckpt \ --video_path ./demo_data/video/source/example.mp4 \ --prompt "Remove the monkey." \ --save_path ./output/demo.mp4demo.py替換為diffusers_demo.py並將--model_path指向其中一個發佈的模型卡片 (僅指令、僅參考或兩者結合)。
訓練
- 數據以 CSV 檔案形式存儲,描述了來源影片、目標影片、可選的參考圖像以及文本提示詞。包含用於圖像僅限、影片僅限以及參考影片階段的演示 CSV 檔案。
- 訓練腳本位於
scripts/。它們使用 Qwen2.5-VL-3B 指令模型搭配 Wan2.2-TI2V-5B 影片骨幹網路來協調一個三階段課程學習 (圖像 → 圖像+影片 → 圖像+影片+參考)。 - 該儲存庫列出了超參數 (解析度、影格數、學習率、步數) 並提供了指向 Hugging Face 上生成的權重檔案。
評估
- 基準測試:OpenVE-Bench (一般影片編輯) 與 RefVIE-Bench (參考引導編輯)。提供了下載連結;並記錄了預期的目錄結構。
- 在基準測試上進行推理是單一指令 (
test_benchmark.py),隨後是適當的評估腳本 (eval_openve_gemini.py或eval_refvie_gemini.py)。
資源
- 專案頁面與論文:https://showlab.github.io/Kiwi-Edit, https://arxiv.org/abs/2603.02175
- 模型中心 (🤗 Hugging Face):針對不同訓練模式的三個 Diffusers 權重。
- 演示空間:https://huggingface.co/spaces/linyq/KiwiEdit
- 致謝數據集與工具:Ditto-1M, OpenVE-3M, ReCo, GPT-Image-Edit-1.5M, EditScore, Qwen2.5-VL, Wan-Video, 等。
誰可以使用它 – 影片擴散模型研究人員、構建 AI 驅動的影片編輯應用程式的開發者,以及希望以可編程方式修改影片內容而無需手動逐影格編輯的創作者。"},
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案