baidu/ERNIE-Image

ERNIE-Image is an open text-to-image generation model developed by the ERNIE-Image team at Baidu. It is built on a single-stream Diffusion Transformer (DiT), with only 8B DiT parameters, it reaches state-of-the-art performance among open-weight text-to-image models.

What it solves

ERNIE-Image 解决了从文字提示生成高质量图像的挑战,特别聚焦于提升图像内文字的渲染、对复杂场景的指令执行,以及制作海报、信息图表等结构化视觉内容的能力。

How it works

模型基于单流 Diffusion Transformer (DiT) 架构,拥有 80 亿参数。它配合一个轻量级的 Prompt Enhancer (PE),将简单的用户输入扩展为详细且结构化的描述,以提升生成质量。提供两个版本:通用的 SFT 模型,以及通过 DMD 与 RL 优化的「Turbo」版本,可在 8 步(相较于 50 步)下实现更快推理。

Who it’s for

此模型适合需要处理大量文字、复杂布局与多样风格(从写实摄影到风格化艺术)的创作者和开发者,且能在具备 24GB VRAM 的消费级 GPU 上运行。

Highlights

  • Superior Text Rendering:在海报与 UI 设计等需要长篇、版面敏感文字的情境下表现卓越。
  • Complex Instruction Following:可靠处理包含多个对象与详细关系的提示。
  • Structured Generation:擅长生成多格构图、漫画与分镜脚本。
  • Efficient Scale:即使仅有 8B 参数,仍能与更大模型竞争性能。
  • Flexible Deployment:支持通过 Diffusers、SGLang 与 ComfyUI 进行集成。