boogu-project/Boogu-Image

Boogu-Image-0.1 is an Apache-2.0 open-source image generation and editing model family that delivers near-closed-source performance with an order of magnitude less data.

解决的问题

Boogu-Image-0.1 是一个开源的统一图像生成与编辑模型家族,旨在提供高质量的文本到图像生成、快速推理和精确的图像编辑。它特别解决了在使用比闭源多模态系统小一个数量级的数据规模(约少一个数量级的训练计算资源)的情况下,仍能实现摄影、风格化以及中英文双语文本渲染方面的竞争力表现这一挑战。

工作原理

该项目提供了一套模型(Base、Turbo、Edit 和 Edit-Turbo),通过系统性地提升理解能力、数据质量与训练流程来实现性能优化。

  • Base:一个针对多样性、可控性以及超密集文本渲染优化的基础模型。
  • Turbo:采用 Decoupled DMD 的蒸馏版本,仅需 3-4 步即可实现高质量写实图像生成。
  • Edit:专为图像到图像转换设计的变体,支持最高 2K 分辨率。
  • Edit-Turbo:编辑模型的快速蒸馏版本。

适用人群

本项目适用于需要高性能、开源替代方案的研究人员和开发者,用于生成写实图像、设计高文本密度布局(如海报、品牌指南)或执行复杂图像编辑任务。

主要亮点

  • 双语文本渲染:在各种布局中均能保持稳定且可读的中英文排版。
  • 精确图像编辑:支持对象插入、替换、删除及材质修改,同时保持主体一致性。
  • 高效推理:Turbo 变体仅需 4 步即可生成写实图像。
  • 多样化输出:支持多种宽高比,最高分辨率可达 2K(适用于 Base 和 Edit 模型)。
  • 广泛硬件支持:包含原生 PyTorch 支持,并提供专用于 Ascend NPU 推理的分支。

相关

  • Dispatch
  • 项目
  • 项目
  • Dispatch
  • 项目