fallenshock/FlowEdit
Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"
FlowEdit – 无需反演的文本引导图像编辑
是什么 – FlowEdit 是 ICCV 2025 最佳学生论文《FlowEdit: 使用预训练流模型实现无需反演的文本引导编辑》的官方 PyTorch 实现。您只需提供源图像、源描述和目标描述,即可完成图像编辑,无需进行扩散过程的反演。该方法复用现有的文本到图像扩散模型(如 Stable Diffusion 3、Flux)和预训练的 流 网络,直接引导生成过程以实现目标编辑。
核心思想
- 无需反演:无需高成本的潜在空间反演;流模型直接将原始图像的噪声轨迹映射到编辑后的轨迹。
- 即插即用:兼容任何可通过 🤗 Diffusers 加载的扩散模型(本仓库提供 SD-3 和 Flux 的示例)。
- 可编辑提示:您提供一个 源提示(原始图像所描述的内容)和一个或多个 目标提示;系统会计算一个简洁的“目标代码”,以编码语义变化。
快速上手
- 克隆与安装
git clone https://github.com/fallenshock/FlowEdit.git cd FlowEdit pip install torch diffusers transformers accelerate sentencepiece protobuf # 若遇到版本冲突,请按 README 建议将 diffusers 固定为 0.30.1 - 运行演示
- 对于 Stable Diffusion 3:
python run_script.py --exp_yaml SD3_exp.yaml - 对于 Flux:
python run_script.py --exp_yaml FLUX_exp.yaml
- 对于 Stable Diffusion 3:
- 编辑您自己的图像
- 将图像放入
example_images/目录。 - 创建一个
edits.yaml文件,描述每项编辑(输入路径、源提示、目标提示(可多个)、可选的目标代码)。 - 创建一个实验 YAML 文件(例如复制
FLUX_exp.yaml),指向您的edits.yaml并设置超参数如n_max和n_min。 - 运行
python run_script.py --exp_yaml <your_experiment.yaml>。
- 将图像放入
与 ComfyUI 的集成
- 仓库链接了社区维护的 Flux 和 HunyuanLoom 的 ComfyUI 节点,以及用于视频编辑的独立 LTX-Video 实现。
相关社区工作
- Training-Free-WAN-Editing – 将 FlowEdit 与 WAN2.1 结合用于视频编辑。
- DNAEdit – 优化高斯噪声以提升编辑质量(NeurIPS 2025 Spotlight)。
- FlowAlign – 为无反演流程添加最优控制轨迹设计(ICLR 2026)。
- DynaEdit – 将 FlowEdit 扩展至动态视频编辑(EECV 2026)。
许可与引用
- MIT 许可证。
- 若在研究中使用代码,请引用 ICCV 2025 论文。
为何重要 FlowEdit 证明了无需高成本的扩散反演,也能实现高质量的文本引导图像编辑,为更快、更灵活的编辑流程打开了大门,可轻松集成到现有的扩散模型工具中。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目