Ideogram 4 發佈:開源權重 9.3B 文字轉圖像模型
Ideogram 4 為專業設計引入結構化 JSON 提示詞
Ideogram 4 是來自 Ideogram 的首款開源權重文字轉圖像模型,其特點是擁有一個從零開始訓練的 9.3B 參數基礎模型。它專為高精度設計工作而設計,提供一流的多語言文字渲染、明確的邊界框(bounding-box)佈局控制,以及原生 2k 解析度支援。
技術架構
Ideogram 4 是一款採用完全單流(single-stream)Diffusion Transformer (DiT) 架構的流匹配(flow-matching)文字轉圖像模型。
單流 DiT
與具有獨立文字與圖像分支的模型不同,Ideogram 4 使用 34 層 transformer,將文字與圖像 token 拼接成單一的統一序列。這種架構允許在過程的每一層進行深度的跨模態交互。
視覺語言文字編碼
Ideogram 4 並非使用標準的純文字編碼器(如 CLIP 或 T5),而是採用了 Qwen3-VL-8B-Instruct。這種視覺語言模型允許系統從 13 個中間層中提取隱藏狀態,為圖像生成器提供從基礎 token 資訊到複雜構圖理解的多尺度語義特徵。
關鍵架構特徵
- 雙分支分類器自由引導(Dual-branch classifier-free guidance): 允許獨立細化條件(正向)與無條件(負向)分支,以分別控制圖像品質與提示詞遵循度。
- 靈活解析度: 原生支援從 256 到 2048(16 的倍數)的解析度,長寬比最高可達 6:1。
透過 JSON 提示詞進行高精度控制
Ideogram 4 專門針對結構化 JSON 標註進行訓練,以最大化訓練效率與接地性(grounding)。雖然模型接受純文字提示詞,但 JSON 格式是實現最大可控性的原生介面。
佈局與顏色控制
- 邊界框佈局(Bounding-Box Layout): 使用者可以透過 JSON 提示詞中的
bbox座標來明確放置主體、文字元素與背景區域。 - 顏色面板條件化(Color Palette Conditioning): 模型在風格描述中支援
colour_palette的 hex 顏色陣列,以引導生成圖像的主導色調。 - 構圖解構: 透過使用邊界框並搭配各元素的描述,實現精確的空間佈局。
Magic Prompt 擴展
為了縮小一般使用者與結構化 JSON 需求之間的差距,Ideogram 提供了 "magic prompt" LLM。此工具在生成前將純文字提示詞擴展為完整的結構化 JSON 標註,確保在不需要使用者手動編寫 JSON 的情況下也能獲得高品質結果。
性能基準測試
在多項第三方與內部基準測試中,Ideogram 4 被定位為面向設計導向生成的領先開源權重模型。
設計與排版
- Design Arena: Ideogram 4 在 Design Arena Elo 排行榜上排名第一,僅次於 GPT 與 Gemini 的專有模型。
- ContraLabs: 在專業設計師進行的盲測排版評估中,Ideogram 4 達到了 47.9% 的第一名勝率,顯著領先於 Gemini 3.1 Flash Image Preview (30.0%) 與 FLUX.2 [max] (15.5%)。
- 實際可用性: 專業設計師在真實客戶工作中的 Ideogram 4 評分最高,達 3.55 / 5。
通用能力
- LMArena: Ideogram 在整體圖像生成實驗室中排名第 5,且是排名第一的開源權重實驗室。
- 開源基準測試: 在 7Bench 佈局控制基準測試中,Ideogram 4 的表現優於所有閉源模型。與較大的模型(如 Qwen-Image (20B)、FLUX.2 [dev] (32B) 與 HunyuanImage 3.0 (80B MoE))相比,它也提供了更優越的文字渲染能力。
模型可用性與授權
Ideogram 4 可在 Hugging Face 上以兩種量化格式提供:
- nf4: 9.3B 參數,支援 CUDA,相容於 Diffusers。
- fp8: 9.3B 參數,支援所有硬體。
兩個版本均根據 Ideogram 4 Non-Commercial License 發佈。
社群回饋
雖然技術能力受到讚賞,但部分社群成員對授權與安全過濾器提出了疑慮。一位 Hacker News 使用者指出:
Non-commercial license, you should not call that "open-weight". Words have meaning. And people are having a laugh at how censored the model is.
快速入門指南
若要在本地使用該模型,使用者必須在 Hugging Face 上接受受限授權(gated license)並透過 hf auth login 進行身份驗證。基本的推理命令使用以下結構:
python run_inference.py \
--prompt "a ginger cat wearing a tiny wizard hat reading a spellbook" \
--output out.png \
--quantization "nf4" \
--magic-prompt-key "$IDEOGRAM_API_KEY"
為了獲得最高品質,建議設定為 --height 2048 --width 2048 與 --sampler-preset V4_QUALITY_48。