boogu-project/Boogu-Image
Boogu-Image-0.1 is an Apache-2.0 open-source image generation and editing model family that delivers near-closed-source performance with an order of magnitude less data.
해결하는 문제
Boogu-Image-0.1은 고품질 텍스트 기반 이미지 생성, 빠른 추론, 정밀한 이미지 편집을 제공하는 오픈소스 통합 이미지 생성 및 편집 모델 패밀리입니다. 특히, 폐쇄형 멀티모달 시스템보다 약 10배 적은 데이터 규모로 사진 촬영, 스타일화, 이중 언어(중국어-영어) 텍스트 렌더링에서 경쟁력 있는 성능을 달성하는 문제를 해결합니다.
작동 방식
이 프로젝트는 이해 능력, 데이터 품질, 트레이닝 파이프라인의 체계적인 개선을 활용한 모델 세트(Base, Turbo, Edit, Edit-Turbo)를 제공합니다.
- Base: 다양성, 제어성, 초고밀도 텍스트 렌더링에 최적화된 기반 모델.
- Turbo: Decoupled DMD를 사용한 정제된 버전으로, 단 3~4단계만으로 고품질의 사실적인 이미지 생성이 가능합니다.
- Edit: 이미지 간 변환에 특화된 버전으로 최대 2K 해상도를 지원합니다.
- Edit-Turbo: 편집 모델의 빠르고 정제된 버전입니다.
대상 사용자
이 프로젝트는 사실적인 이미지 생성, 텍스트가 많은 레이아웃(포스터, 브랜드 가이드 등) 설계, 또는 복잡한 이미지 편집 작업이 필요한 멀티모달 생성 분야의 연구자 및 개발자에게 적합합니다.
주요 특징
- 이중 언어 텍스트 렌더링: 다양한 레이아웃에서 안정적이고 가독성 높은 중국어 및 영어 타이포그래피.
- 정밀한 이미지 편집: 객체 삽입, 교체, 제거, 재질 변경을 지원하면서 주제의 일관성을 유지.
- 고효율 추론: Turbo 버전은 단 4단계로 사실적인 결과를 제공합니다.
- 다양한 출력 형식: 여러 종횡비와 최대 2K 해상도(기본 및 Edit 모델)를 지원.
- 광범위한 하드웨어 지원: 네이티브 PyTorch 지원과 함께 Ascend NPU 추론을 위한 전용 브랜치 제공.
관련
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트