baidu/ERNIE-Image
ERNIE-Image is an open text-to-image generation model developed by the ERNIE-Image team at Baidu. It is built on a single-stream Diffusion Transformer (DiT), with only 8B DiT parameters, it reaches state-of-the-art performance among open-weight text-to-image models.
What it solves
ERNIE-Image 解決了從文字提示生成高品質圖像的挑戰,特別聚焦於提升圖像內文字的渲染、對複雜場景的指令執行,以及製作海報、資訊圖表等結構化視覺內容的能力。
How it works
模型基於單流 Diffusion Transformer (DiT) 架構,擁有 80 億參數。它搭配一個輕量級的 Prompt Enhancer (PE),將簡單的使用者輸入擴展為詳細且結構化的描述,以提升生成品質。提供兩個版本:通用的 SFT 模型,以及透過 DMD 與 RL 優化的「Turbo」版本,可在 8 步驟(相較於 50 步驟)下實現更快推理。
Who it’s for
此模型適合需要處理大量文字、複雜版面與多樣風格(從寫實攝影到風格化藝術)的創作者與開發者,且能在具備 24GB VRAM 的消費級 GPU 上運行。
Highlights
- Superior Text Rendering:在海報與 UI 設計等需要長篇、版面敏感文字的情境下表現卓越。
- Complex Instruction Following:可靠處理包含多個物件與詳細關係的提示。
- Structured Generation:擅長生成多格構圖、漫畫與分鏡腳本。
- Efficient Scale:即使僅有 8B 參數,仍能與更大模型競爭性能。
- Flexible Deployment:支援透過 Diffusers、SGLang 與 ComfyUI 進行整合。