ATH-MaaS/Ovis-Image

Ovis-Image is a 7B text-to-image model specifically optimized for high-quality text rendering, designed to operate efficiently under stringent computational constraints.

What it solves

Ovis-Image 解決了在生成影像中渲染高品質、易讀且拼寫正確的文字的困難,特別是在使用較小、計算效能較高的模型時。它特別針對版面敏感的內容,如海報、標誌、橫幅與 UI 原型,這些情境下文字與視覺設計的對齊至關重要。

How it works

Ovis-Image 是一個基於 Ovis-U1 架構的 7B 參數文字生成影像模型。它的體積足以在單張高階 GPU(記憶體適中)上運行,同時保持與更大 20B 級系統或封閉源模型(如 GPT-4o)相當的文字渲染品質。

Who it’s for

此專案適合需要在 AI 生成影像中獲得高保真文字渲染的開發者與研究人員,且受限於嚴格的計算資源或需要低延遲的互動使用情境。

Highlights

  • Compact Scale: 在 7B 參數預算內提供 20B 級別的文字渲染品質。
  • Layout Precision: 在各種字型、大小與長寬比下,均能產生易讀且語意一致的排版。
  • High Deployability: 可在單張 GPU 上運行,且已整合至 diffusersvllm-omnistable-diffusion.cppComfyUI 等主流框架。
  • Strong Performance: 在 CVTG-2K、LongText-Bench 等文字渲染基準測試上,表現優於多個更大型的模型。