fallenshock/FlowEdit
Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"
FlowEdit – 無需反演的文本引導影像編輯
是什麼 – FlowEdit 是 ICCV 2025 最佳學生論文《FlowEdit: 使用預訓練流模型實現無需反演的文本引導編輯》的官方 PyTorch 實作。您只需提供來源影像、來源說明與目標說明,即可完成影像編輯,無需進行擴散過程的反演。該方法重用現有的文字到影像擴散模型(例如 Stable Diffusion 3、Flux)與預訓練的 流 網路,直接引導生成過程以達成目標編輯。
核心概念
- 無需反演:無需高成本的潛在空間反演;流模型直接將原始影像的雜訊軌跡映射至編輯後的軌跡。
- 即插即用:相容任何可透過 🤗 Diffusers 載入的擴散模型(本倉儲提供 SD-3 與 Flux 的範例)。
- 可編輯提示:您提供一個 來源提示(原始影像所描述的內容)與一個或以上的 目標提示;系統會計算一個簡潔的「目標碼」,以編碼語意變動。
快速上手
- 克隆與安裝
git clone https://github.com/fallenshock/FlowEdit.git cd FlowEdit pip install torch diffusers transformers accelerate sentencepiece protobuf # 若遇到版本衝突,請依 README 建議將 diffusers 固定為 0.30.1 - 執行示範
- 對於 Stable Diffusion 3:
python run_script.py --exp_yaml SD3_exp.yaml - 對於 Flux:
python run_script.py --exp_yaml FLUX_exp.yaml
- 對於 Stable Diffusion 3:
- 編輯您自己的影像
- 將影像放入
example_images/目錄。 - 建立一個
edits.yaml檔案,描述每一項編輯(輸入路徑、來源提示、目標提示(可多個)、可選的目標碼)。 - 建立一個實驗 YAML 檔案(例如複製
FLUX_exp.yaml),指向您的edits.yaml並設定超參數如n_max與n_min。 - 執行
python run_script.py --exp_yaml <your_experiment.yaml>。
- 將影像放入
與 ComfyUI 的整合
- 倉儲連結了社群維護的 Flux 與 HunyuanLoom 的 ComfyUI 節點,以及用於影片編輯的獨立 LTX-Video 實作。
相關社群工作
- Training-Free-WAN-Editing – 將 FlowEdit 與 WAN2.1 結合用於影片編輯。
- DNAEdit – 優化高斯雜訊以提升編輯品質(NeurIPS 2025 Spotlight)。
- FlowAlign – 為無反演流程新增最佳控制軌跡設計(ICLR 2026)。
- DynaEdit – 將 FlowEdit 擴展至動態影片編輯(EECV 2026)。
授權與引用
- MIT 授權。
- 若在研究中使用程式碼,請引用 ICCV 2025 論文。
為何重要 FlowEdit 證明了無需高成本的擴散反演,也能實現高品質的文本引導影像編輯,為更快、更彈性的編輯流程打開大門,可輕鬆整合至現有的擴散模型工具中。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案