fallenshock/FlowEdit

Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"

FlowEdit – 無需反演的文本引導影像編輯

是什麼 – FlowEdit 是 ICCV 2025 最佳學生論文《FlowEdit: 使用預訓練流模型實現無需反演的文本引導編輯》的官方 PyTorch 實作。您只需提供來源影像、來源說明與目標說明,即可完成影像編輯,無需進行擴散過程的反演。該方法重用現有的文字到影像擴散模型(例如 Stable Diffusion 3、Flux)與預訓練的 網路,直接引導生成過程以達成目標編輯。

核心概念

  • 無需反演:無需高成本的潛在空間反演;流模型直接將原始影像的雜訊軌跡映射至編輯後的軌跡。
  • 即插即用:相容任何可透過 🤗 Diffusers 載入的擴散模型(本倉儲提供 SD-3 與 Flux 的範例)。
  • 可編輯提示:您提供一個 來源提示(原始影像所描述的內容)與一個或以上的 目標提示;系統會計算一個簡潔的「目標碼」,以編碼語意變動。

快速上手

  1. 克隆與安裝
    git clone https://github.com/fallenshock/FlowEdit.git
    cd FlowEdit
    pip install torch diffusers transformers accelerate sentencepiece protobuf
    # 若遇到版本衝突,請依 README 建議將 diffusers 固定為 0.30.1
    
  2. 執行示範
    • 對於 Stable Diffusion 3:python run_script.py --exp_yaml SD3_exp.yaml
    • 對於 Flux:python run_script.py --exp_yaml FLUX_exp.yaml
  3. 編輯您自己的影像
    • 將影像放入 example_images/ 目錄。
    • 建立一個 edits.yaml 檔案,描述每一項編輯(輸入路徑、來源提示、目標提示(可多個)、可選的目標碼)。
    • 建立一個實驗 YAML 檔案(例如複製 FLUX_exp.yaml),指向您的 edits.yaml 並設定超參數如 n_maxn_min
    • 執行 python run_script.py --exp_yaml <your_experiment.yaml>

與 ComfyUI 的整合

  • 倉儲連結了社群維護的 Flux 與 HunyuanLoom 的 ComfyUI 節點,以及用於影片編輯的獨立 LTX-Video 實作。

相關社群工作

  • Training-Free-WAN-Editing – 將 FlowEdit 與 WAN2.1 結合用於影片編輯。
  • DNAEdit – 優化高斯雜訊以提升編輯品質(NeurIPS 2025 Spotlight)。
  • FlowAlign – 為無反演流程新增最佳控制軌跡設計(ICLR 2026)。
  • DynaEdit – 將 FlowEdit 擴展至動態影片編輯(EECV 2026)。

授權與引用

  • MIT 授權。
  • 若在研究中使用程式碼,請引用 ICCV 2025 論文。

為何重要 FlowEdit 證明了無需高成本的擴散反演,也能實現高品質的文本引導影像編輯,為更快、更彈性的編輯流程打開大門,可輕鬆整合至現有的擴散模型工具中。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案