baidu/ERNIE-Image
ERNIE-Image is an open text-to-image generation model developed by the ERNIE-Image team at Baidu. It is built on a single-stream Diffusion Transformer (DiT), with only 8B DiT parameters, it reaches state-of-the-art performance among open-weight text-to-image models.
What it solves
ERNIE-Image는 텍스트 프롬프트로부터 고품질 이미지를 생성하는 문제를 해결합니다. 특히 이미지 내 텍스트 렌더링 개선, 복잡한 장면에 대한 명령 수행, 포스터·인포그래픽 등 구조화된 시각 콘텐츠 제작에 중점을 두고 있습니다.
How it works
이 모델은 80억 파라미터를 가진 단일 스트림 Diffusion Transformer (DiT) 기반입니다. 가벼운 Prompt Enhancer (PE)와 결합해 간단한 사용자 입력을 상세하고 구조화된 설명으로 확장함으로써 생성 품질을 높입니다. 일반용 SFT 모델과 DMD·RL로 최적화된 "Turbo" 버전 두 가지가 제공되며, Turbo는 50스텝 대신 8스텝으로 빠른 추론이 가능합니다.
Who it’s for
텍스트가 많이 포함된 이미지, 복잡한 레이아웃, 다양한 스타일(실사 사진부터 스타일화된 아트까지)을 다룰 수 있는 텍스트‑투‑이미지 모델이 필요한 크리에이터와 개발자를 위해 설계되었습니다. 24GB VRAM을 갖춘 소비자용 GPU에서도 실행할 수 있습니다.
Highlights
- Superior Text Rendering:포스터와 UI 디자인 등 긴 텍스트와 레이아웃에 민감한 경우에 높은 성능을 발휘합니다.
- Complex Instruction Following:여러 객체와 상세 관계를 포함한 프롬프트를 안정적으로 처리합니다.
- Structured Generation:멀티패널 구성, 만화, 스토리보드 제작에 효과적입니다.
- Efficient Scale:컴팩트한 8B 파라미터 크기에도 불구하고 더 큰 모델과 경쟁할 수 있는 성능을 제공합니다.
- Flexible Deployment:Diffusers, SGLang, ComfyUI를 통한 통합을 지원합니다.