FireRedTeam/FireRed-Image-Edit

FireRed-Image-Edit is a powerful image editing foundation model achieving open-source state-of-the-art performance with precise instruction following, high-fidelity generation, superior identity consistency, and seamless multi-element fusion.

What it solves

FireRed-Image-Edit 是一個通用的圖像編輯模型,旨在於各種場景中提供高保真度、一致性的編輯。它解決了 AI 圖像編輯中的常見挑戰,例如在複雜變化中保持角色身份、將來自不同圖像的多個視覺元素融合到一個場景中,以及準確遵循詳細的自然語言指令。

How it works

該專案使用一種與骨幹網絡無關的架構,透過 Pretrain $\rightarrow$ SFT $\rightarrow$ RL 流水線注入編輯能力。它原生支持 1-3 張輸入圖像。對於涉及超過 3 張圖像的更複雜任務,它採用了一個智能 Agent 模組,該模組使用 ROI (Region of Interest) 檢測來裁剪並將圖像拼接成合成圖像,並使用基於 LLM 的重新描述系統來重寫指令以獲得更好的上下文。

Who it’s for

此工具是為創作者、設計師和開發者設計的,他們需要專業級的圖像處理,例如人像修圖、舊照片修復以及複雜場景構圖,而無需進行大量的提示詞工程。

Highlights

  • Identity Consistency: 在編輯過程中保留主體身份的開源性能領先地位。
  • Multi-Element Fusion: 使用自動化 Agent 驅動的裁剪與拼接工作流,具備結合 10 種以上元素的能力。
  • Engineering Optimizations: 包含蒸餾、量化與靜態編譯,以在 30GB VRAM 下實現 4.5s 的生成時間。
  • Extensible Ecosystem: 提供完整的 LoRA 訓練代碼與原生 ComfyUI 節點支持。
  • Curation of Specialized Effects: 專用於專業人像妝容與高保真風格化文本參考的專用能力。"},