baidu/ERNIE-Image

ERNIE-Image is an open text-to-image generation model developed by the ERNIE-Image team at Baidu. It is built on a single-stream Diffusion Transformer (DiT), with only 8B DiT parameters, it reaches state-of-the-art performance among open-weight text-to-image models.

What it solves

ERNIE-Image は、テキストプロンプトから高品質な画像を生成する課題を解決します。特に画像内テキストの描画精度向上、複雑シーンに対する指示実行、ポスターやインフォグラフィックといった構造化ビジュアルコンテンツの作成に焦点を当てています。

How it works

このモデルは、8 億パラメータのシングルストリーム Diffusion Transformer (DiT) を基盤としています。軽量な Prompt Enhancer (PE) と組み合わせ、シンプルなユーザー入力を詳細かつ構造化された記述に拡張し、生成品質を向上させます。一般用途向け SFT モデルと、DMD と RL で最適化された「Turbo」バージョンの 2 種類が提供され、Turbo は 50 ステップではなく 8 ステップで高速推論が可能です。

Who it’s for

テキストが密集した画像、複雑なレイアウト、多様なスタイル(リアルな写真からスタイライズドアートまで)を扱えるテキスト‑ツー‑イメージモデルを必要とするクリエイターや開発者向けです。24GB VRAM のコンシューマ GPU でも動作します。

Highlights

  • Superior Text Rendering:ポスターや UI デザインなど、長文でレイアウトに敏感なテキスト生成に高い熟練度を発揮。
  • Complex Instruction Following:複数オブジェクトや詳細な関係を含むプロンプトを確実に処理。
  • Structured Generation:マルチパネル構成、コミック、ストーリーボードの作成が得意。
  • Efficient Scale:コンパクトな 8B パラメータサイズにもかかわらず、より大規模なモデルと競合できる性能。
  • Flexible Deployment:Diffusers、SGLang、ComfyUI を通じた統合をサポート。