FireRedTeam/FireRed-Image-Edit

FireRed-Image-Edit is a powerful image editing foundation model achieving open-source state-of-the-art performance with precise instruction following, high-fidelity generation, superior identity consistency, and seamless multi-element fusion.

What it solves

FireRed-Image-Edit은 다양한 시나리오에서 고정밀도 및 일관된 편집을 제공하도록 설계된 범용 이미지 편집 모델입니다. 캐릭터 정체성을 복잡한 변화 속에서도 유지하고, 서로 다른 이미지에서 여러 시각적 요소를 하나의 장면으로 융합하며, 상세한 자연어 지침을 정확하게 따르는 것과 같은 AI 이미지 편집의 일반적인 과제를 해결합니다.

How it works

이 프로젝트는 Pretrain $\rightarrow$ SFT $\rightarrow$ RL 파이프라인을 통해 편집 기능을 주입하는 백본 불가지론적(backbone-agnostic) 아키텍처를 사용합니다. 기본적으로 1-3장의 입력 이미지를 지원합니다. 3장 이상의 이미지를 포함하는 더 복잡한한 작업의 경우, ROI (Region of Interest) 탐지를 사용하여 이미지를 자르고 이어 붙여 합성 이미지를 만드는 지능형 Agent 모듈과, 더 나은 문맥을 위해 지침을 다시 작성하는 LLM 기반의 recaptioning 시스템을 사용합니다.

Who it’s for

이 도구는 전문적인 수준의 이미지 조작이 필요한 크리에이터, 디자이너 및 개발자를 위해 설계되었습니다. 예를 들어, 인물 리터칭, 오래된 사진 복원, 복잡한 장면 구성 등을 광범위한 프롬프트 엔지니어링 없이도 수행할 수 있습니다.

Highlights

  • Identity Consistency: 편집 중 피사체의 정체성을 유지하는 최첨단 오픈소스 성능.
  • Multi-Element Fusion: 자동화된 Agent 기반의 크로핑 및 스티칭 워크플로우를 사용하여 10개 이상의 요소를 결합할 수 있습니다.
  • Engineering Optimizations: 증류(distillation), 양자화(quantization) 및 정적 컴파일을 포함하여 30GB VRAM에서 4.5초의 생성 시간을 달성합니다.
  • Extensible Ecosystem: 전체 LoRA 학습 코드와 네이티브 ComfyUI 노드 지원을 제공합니다.
  • Curation of Specialized Effects: 전문적인 인물 메이크업 및 고정밀 스타일화된 텍스트 참조를 위한 전용 기능을 제공합니다.