boogu-project/Boogu-Image

Boogu-Image-0.1 is an Apache-2.0 open-source image generation and editing model family that delivers near-closed-source performance with an order of magnitude less data.

解決的問題

Boogu-Image-0.1 是一個開源的統一圖像生成與編輯模型家族,旨在提供高品質的文本轉圖像生成、快速推論與精確的圖像編輯。它特別解決了在使用比封閉式多模態系統小一個數量級的資料規模(約少一個數量級的訓練運算資源)的情況下,仍能實現攝影、風格化以及中英文雙語文字渲染方面的競爭力表現這一挑戰。

工作原理

本專案提供一組模型(Base、Turbo、Edit 和 Edit-Turbo),透過系統性提升理解能力、資料品質與訓練流程來實現效能優化。

  • Base:針對多樣性、可控性以及超密集文字渲染優化之基礎模型。
  • Turbo:採用 Decoupled DMD 的蒸餾版本,僅需 3-4 步即可實現高品質寫實圖像生成。
  • Edit:專為圖像到圖像轉換設計的變體,支援最高 2K 解析度。
  • Edit-Turbo:編輯模型的快速蒸餾版本。

適用對象

本專案適用於需要高性能量、開源替代方案的研究人員與開發者,用於生成寫實圖像、設計高文字密度的版面(如海報、品牌指南)或執行複雜圖像編輯任務。

主要亮點

  • 雙語文字渲染:在各種版面中均能保持穩定且可讀的中英文排版。
  • 精確圖像編輯:支援物件插入、替換、刪除及材質修改,同時保持主體一致性。
  • 高效推論:Turbo 變體僅需 4 步即可生成寫實圖像。
  • 多樣化輸出:支援多種寬高比,最高解析度可達 2K(適用於 Base 和 Edit 模型)。
  • 廣泛硬體支援:包含原生 PyTorch 支援,並提供專用於 Ascend NPU 推論的分支。

相關

  • Dispatch
  • 專案
  • 專案
  • Dispatch
  • 專案