FireRedTeam/FireRed-Image-Edit

FireRed-Image-Edit is a powerful image editing foundation model achieving open-source state-of-the-art performance with precise instruction following, high-fidelity generation, superior identity consistency, and seamless multi-element fusion.

What it solves

FireRed-Image-Edit は、さまざまなシナリオにおいて高精度で一貫性のある編集を提供するために設計された汎用画像編集モデルです。複雑な変化の中でもキャラクターのアイデンティティを維持したり、異なる画像から複数の視覚的要素を一つのシーンに融合させたり、詳細な自然言語指示に従って正確に編集したりするといった、AI 画像編集における一般的な課題を解決します。

How it works

このプロジェクトは、Pretrain $\rightarrow$ SFT $\rightarrow$ RL パイプラインを通じて編集機能を注入する、バックボーンに依存しないアーキテクチャを採用しています。標準で 1-3 枚の入力画像に対応しています。3 枚を超える画像を含むより複雑なタスクには、ROI (Region of Interest) 検出を使用して画像を切り抜き、合成画像を作成するために画像を繋ぎ合わせるインテリジェントな Agent モジュールと、より良いコンテキストを得るために指示を書き換える LLM ベースの再キャプションシステムを使用します。

Who it’s for

このツールは、プロフェッショナル級の画像操作が必要なクリエイター、デザイナー、開発者向けに設計されています。例えば、ポートレートのリタッチ、古い写真の修復、複雑なシーンの構成など、高度なプロンプトエンジニアリングを必要とせずに実現可能です。

Highlights

  • Identity Consistency: 編集中の被写体のアイデンティティを保持する、最先端のオープンソース性能。
  • Multi-Element Fusion: 自動化された Agent 駆動のクロッピングとスティッチングのワークフローを使用して、10 個以上の要素を組み合わせることができます。
  • Engineering Optimizations: 蒸留、量子化、および静的コンパイルを含み、30GB VRAM で 4.5s の生成時間を実現します。
  • Extensible Ecosystem: 完全な LoRA トレーニングコードとネイティブな ComfyUI ノードのサポートを提供します。
  • Curation of Specialized Effects: プロフェッショナルなポートレートメイクアップや高精度なスタイライズドテキスト参照に特化した機能を提供します。