fallenshock/FlowEdit

Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"

FlowEdit – 潜在空間の逆変換を必要としないテキストベースの画像編集

何であるか – FlowEdit は ICCV 2025 最優秀学生論文 「FlowEdit: 事前学習済みフロー モデルを用いた潜在空間逆変換不要なテキストベース編集」 の公式 PyTorch 実装です。元の画像の説明文(ソース プロンプト)と目的の編集内容を示す説明文(ターゲット プロンプト)を提供するだけで、拡散プロセスの逆変換を必要とせずに画像を編集できます。この手法は既存のテキストから画像への拡散モデル(例: Stable Diffusion 3, Flux)と事前学習済みの フロー ネットワークを再利用し、望ましい編集結果に導くように生成を制御します。

主なアイデア

  • 逆変換不要:高コストな潜在空間の逆変換は不要。フロー モデルが元の画像のノイズ軌道を直接編集後のものにマッピングします。
  • 即時接続:🤗 Diffusers でロード可能な任意の拡散モデルと互換性があります(本リポジトリには SD-3 と Flux の例が含まれています)。
  • 編集可能なプロンプトソース プロンプト(元の画像が示す内容)と、1つ以上の ターゲット プロンプト を入力します。システムは意味的な変化を要約した「ターゲット コード」を計算します。

導入方法

  1. クローン & インストール
    git clone https://github.com/fallenshock/FlowEdit.git
    cd FlowEdit
    pip install torch diffusers transformers accelerate sentencepiece protobuf
    # バージョンの衝突が発生した場合、README に従い diffusers を 0.30.1 にピン留めしてください
    
  2. デモの実行
    • Stable Diffusion 3 用: python run_script.py --exp_yaml SD3_exp.yaml
    • Flux 用: python run_script.py --exp_yaml FLUX_exp.yaml
  3. 独自の画像を編集する
    • 画像を example_images/ ディレクトリに配置します。
    • 各編集内容を記述する edits.yaml を作成します(入力パス、ソース プロンプト、ターゲット プロンプト(複数可)、オプションのターゲット コード)。
    • edits.yaml を指す実験用 YAML ファイル(例: FLUX_exp.yaml をコピー)を作成し、n_maxn_min などのハイパーパラメータを設定します。
    • python run_script.py --exp_yaml <your_experiment.yaml> を実行します。

ComfyUI との統合

  • リポジトリは、コミュニティメンテナンスの ComfyUI ノード(Flux および HunyuanLoom 用)と、動画編集用の別実装 LTX-Video へのリンクを提供しています。

関連するコミュニティの取り組み

  • Training-Free-WAN-Editing – FlowEdit と WAN2.1 を組み合わせて動画編集を実現。
  • DNAEdit – ガウスノイズの最適化により編集品質を向上(NeurIPS 2025 スポットライト)。
  • FlowAlign – 潜在空間逆変換不要なパイプラインに最適制御軌道設計を追加(ICLR 2026)。
  • DynaEdit – FlowEdit を動的動画編集に拡張(EECV 2026)。

ライセンス & 引用

  • MIT ライセンス。
  • 研究でコードを使用する場合は、ICCV 2025 の論文を引用してください。

なぜ重要なのか FlowEdit は、拡散逆変換の高コストな計算を必要とせずに、高品質なテキスト誘導画像編集を実現できることを示しており、既存の拡散モデルベースのツールに簡単に統合できる、より高速で柔軟な編集パイプラインの開発を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト