boogu-project/Boogu-Image

Boogu-Image-0.1 is an Apache-2.0 open-source image generation and editing model family that delivers near-closed-source performance with an order of magnitude less data.

何を解決するか

Boogu-Image-0.1 は、高品質なテキストから画像生成、高速推論、正確な画像編集を提供するオープンソースの統合型画像生成・編集モデルファミリーです。特に、閉鎖型マルチモーダルシステムと比較して、約1桁小さいデータ規模で、写真撮影、スタイリゼーション、およびバイリンガル(中国語-英語)テキストレンダリングにおいて競争力のあるパフォーマンスを実現するという課題に取り組んでいます。

どう動くか

このプロジェクトは、理解能力、データ品質、トレーニングパイプラインにおける体系的な改善を活用したモデル群(Base、Turbo、Edit、Edit-Turbo)を提供します。

  • Base:多様性、制御性、超高密度テキストレンダリングに最適化された基盤モデル。
  • Turbo:Decoupled DMD を使用した蒸留バージョンで、わずか3〜4ステップで高品質な写実的生成を可能にします。
  • Edit:画像から画像への変換に特化したバージョンで、最大2K解像度をサポートします。
  • Edit-Turbo:編集モデルの高速で蒸留されたバージョンです。

誰向けか

このプロジェクトは、写実的な画像生成、テキストを多く含むレイアウト(ポスター、ブランドガイドなど)の設計、または複雑な画像編集タスクに必要な高性能でオープンソースの代替手段を求めるマルチモーダル生成分野の研究者や開発者向けです。

特徴

  • バイリンガルテキストレンダリング:多様なレイアウトにおいて安定的で読みやすい中国語および英語のフォント表現。
  • 正確な画像編集:オブジェクトの挿入、置換、削除、素材の変更をサポートしながら、対象の整合性を維持。
  • 高効率推論:Turbo バージョンはわずか4ステップで写実的な結果を提供。
  • 多様な出力:複数のアスペクト比と最大2K解像度(BaseおよびEditモデル)をサポート。
  • 広範なハードウェア対応:ネイティブな PyTorch 対応に加え、Ascend NPU 推論用の専用ブランチも提供。

関連