fallenshock/FlowEdit

Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"

FlowEdit – 无需反演的文本引导图像编辑

是什么 – FlowEdit 是 ICCV 2025 最佳学生论文《FlowEdit: 使用预训练流模型实现无需反演的文本引导编辑》的官方 PyTorch 实现。您只需提供源图像、源描述和目标描述,即可完成图像编辑,无需进行扩散过程的反演。该方法复用现有的文本到图像扩散模型(如 Stable Diffusion 3、Flux)和预训练的 网络,直接引导生成过程以实现目标编辑。

核心思想

  • 无需反演:无需高成本的潜在空间反演;流模型直接将原始图像的噪声轨迹映射到编辑后的轨迹。
  • 即插即用:兼容任何可通过 🤗 Diffusers 加载的扩散模型(本仓库提供 SD-3 和 Flux 的示例)。
  • 可编辑提示:您提供一个 源提示(原始图像所描述的内容)和一个或多个 目标提示;系统会计算一个简洁的“目标代码”,以编码语义变化。

快速上手

  1. 克隆与安装
    git clone https://github.com/fallenshock/FlowEdit.git
    cd FlowEdit
    pip install torch diffusers transformers accelerate sentencepiece protobuf
    # 若遇到版本冲突,请按 README 建议将 diffusers 固定为 0.30.1
    
  2. 运行演示
    • 对于 Stable Diffusion 3:python run_script.py --exp_yaml SD3_exp.yaml
    • 对于 Flux:python run_script.py --exp_yaml FLUX_exp.yaml
  3. 编辑您自己的图像
    • 将图像放入 example_images/ 目录。
    • 创建一个 edits.yaml 文件,描述每项编辑(输入路径、源提示、目标提示(可多个)、可选的目标代码)。
    • 创建一个实验 YAML 文件(例如复制 FLUX_exp.yaml),指向您的 edits.yaml 并设置超参数如 n_maxn_min
    • 运行 python run_script.py --exp_yaml <your_experiment.yaml>

与 ComfyUI 的集成

  • 仓库链接了社区维护的 Flux 和 HunyuanLoom 的 ComfyUI 节点,以及用于视频编辑的独立 LTX-Video 实现。

相关社区工作

  • Training-Free-WAN-Editing – 将 FlowEdit 与 WAN2.1 结合用于视频编辑。
  • DNAEdit – 优化高斯噪声以提升编辑质量(NeurIPS 2025 Spotlight)。
  • FlowAlign – 为无反演流程添加最优控制轨迹设计(ICLR 2026)。
  • DynaEdit – 将 FlowEdit 扩展至动态视频编辑(EECV 2026)。

许可与引用

  • MIT 许可证。
  • 若在研究中使用代码,请引用 ICCV 2025 论文。

为何重要 FlowEdit 证明了无需高成本的扩散反演,也能实现高质量的文本引导图像编辑,为更快、更灵活的编辑流程打开了大门,可轻松集成到现有的扩散模型工具中。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目