boogu-project/Boogu-Image

Boogu-Image-0.1 is an Apache-2.0 open-source image generation and editing model family that delivers near-closed-source performance with an order of magnitude less data.

해결하는 문제

Boogu-Image-0.1은 고품질 텍스트 기반 이미지 생성, 빠른 추론, 정밀한 이미지 편집을 제공하는 오픈소스 통합 이미지 생성 및 편집 모델 패밀리입니다. 특히, 폐쇄형 멀티모달 시스템보다 약 10배 적은 데이터 규모로 사진 촬영, 스타일화, 이중 언어(중국어-영어) 텍스트 렌더링에서 경쟁력 있는 성능을 달성하는 문제를 해결합니다.

작동 방식

이 프로젝트는 이해 능력, 데이터 품질, 트레이닝 파이프라인의 체계적인 개선을 활용한 모델 세트(Base, Turbo, Edit, Edit-Turbo)를 제공합니다.

  • Base: 다양성, 제어성, 초고밀도 텍스트 렌더링에 최적화된 기반 모델.
  • Turbo: Decoupled DMD를 사용한 정제된 버전으로, 단 3~4단계만으로 고품질의 사실적인 이미지 생성이 가능합니다.
  • Edit: 이미지 간 변환에 특화된 버전으로 최대 2K 해상도를 지원합니다.
  • Edit-Turbo: 편집 모델의 빠르고 정제된 버전입니다.

대상 사용자

이 프로젝트는 사실적인 이미지 생성, 텍스트가 많은 레이아웃(포스터, 브랜드 가이드 등) 설계, 또는 복잡한 이미지 편집 작업이 필요한 멀티모달 생성 분야의 연구자 및 개발자에게 적합합니다.

주요 특징

  • 이중 언어 텍스트 렌더링: 다양한 레이아웃에서 안정적이고 가독성 높은 중국어 및 영어 타이포그래피.
  • 정밀한 이미지 편집: 객체 삽입, 교체, 제거, 재질 변경을 지원하면서 주제의 일관성을 유지.
  • 고효율 추론: Turbo 버전은 단 4단계로 사실적인 결과를 제공합니다.
  • 다양한 출력 형식: 여러 종횡비와 최대 2K 해상도(기본 및 Edit 모델)를 지원.
  • 광범위한 하드웨어 지원: 네이티브 PyTorch 지원과 함께 Ascend NPU 추론을 위한 전용 브랜치 제공.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트