fallenshock/FlowEdit

Official implementation of the paper: "FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models"

FlowEdit – 잠재 공간 역변환을 필요로 하지 않는 텍스트 기반 이미지 편집

무엇인가요 – FlowEdit 는 ICCV 2025 최우수 학생 논문 "FlowEdit: 사전 학습된 흐름 모델을 이용한 잠재 공간 역변환 없이 텍스트 기반 편집" 의 공식 PyTorch 구현입니다. 확산 프로세스의 역변환을 필요로 하지 않고, 원본 이미지의 설명문과 목표 설명문을 제공함으로써 이미지를 편집할 수 있습니다. 이 방법은 기존의 텍스트-이미지 확산 모델(예: Stable Diffusion 3, Flux)과 사전 학습된 흐름 네트워크를 재사용하여 원하는 편집 결과로 생성을 유도합니다.

핵심 아이디어

  • 역변환 없음: 고비용의 잠재 공간 역변환 없이, 흐름 모델이 원본 이미지의 노이즈 경로를 직접 편집된 경로로 매핑합니다.
  • 즉시 사용 가능: 🤗 Diffusers 로 로드 가능한 모든 확산 모델과 호환됩니다(본 리포지토리에는 SD-3 및 Flux 예제 포함).
  • 편집 가능한 프롬프트: 원본 프롬프트(원본 이미지가 나타내는 내용)와 하나 이상의 목표 프롬프트를 제공합니다. 시스템은 의미적 변화를 요약한 '목표 코드'를 계산합니다.

시작하기

  1. 클론 및 설치
    git clone https://github.com/fallenshock/FlowEdit.git
    cd FlowEdit
    pip install torch diffusers transformers accelerate sentencepiece protobuf
    # 버전 충돌이 발생하면 README에 따라 diffusers를 0.30.1로 고정하세요
    
  2. 데모 실행
    • Stable Diffusion 3: python run_script.py --exp_yaml SD3_exp.yaml
    • Flux: python run_script.py --exp_yaml FLUX_exp.yaml
  3. 자신의 이미지 편집하기
    • 이미지를 example_images/ 폴더에 넣습니다.
    • 각 편집 내용을 설명하는 edits.yaml 파일을 만듭니다(입력 경로, 원본 프롬프트, 목표 프롬프트(복수 가능), 선택적 목표 코드).
    • edits.yaml을 가리키고 n_max, n_min과 같은 하이퍼파라미터를 설정하는 실험용 YAML 파일을 만듭니다(예: FLUX_exp.yaml 복사).
    • python run_script.py --exp_yaml <your_experiment.yaml>를 실행합니다.

ComfyUI 통합

  • 리포지토리는 커뮤니티 유지 관리 ComfyUI 노드(Flux 및 HunyuanLoom용)와 동영상 편집용 별도의 LTX-Video 구현을 링크합니다.

관련 커뮤니티 작업

  • Training-Free-WAN-Editing – FlowEdit와 WAN2.1을 결합하여 동영상 편집 가능.
  • DNAEdit – 가우시안 노이즈를 개선하여 편집 품질 향상(NEURIPS 2025 스포트라이트).
  • FlowAlign – 역변환 없이 최적 제어 경로 설계를 추가(ICLR 2026).
  • DynaEdit – FlowEdit을 동적 동영상 편집으로 확장(EECV 2026).

라이선스 및 인용

  • MIT 라이선스.
  • 연구에서 코드를 사용할 경우 ICCV 2025 논문을 인용하세요.

왜 중요한가요 FlowEdit 는 확산 역변환의 고비용 계산 없이도 고품질의 텍스트 기반 이미지 편집이 가능함을 보여주며, 기존 확산 기반 도구에 쉽게 통합할 수 있는 더 빠르고 유연한 편집 파이프라인의 개발을 가능하게 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트