ATH-MaaS/Ovis-Image

Ovis-Image is a 7B text-to-image model specifically optimized for high-quality text rendering, designed to operate efficiently under stringent computational constraints.

What it solves

Ovis-Image は、生成画像内で高品質で読みやすく、正しく綴られたテキストを描画することの難しさを解決します。特に、より小さく計算コストの低いモデルを使用する際に顕著です。ポスター、ロゴ、バナー、UI モックアップなど、テキストとビジュアルデザインの整合性が重要なレイアウト依存コンテンツを対象としています。

How it works

Ovis-Image は Ovis-U1 アーキテクチャ上に構築された 7B パラメータのテキスト‑ツー‑イメージモデルです。中程度のメモリを持つハイエンド GPU 1 台で動作できるコンパクトさを保ちつつ、20B クラスのシステムや GPT-4o のようなクローズドソースモデルに匹敵するテキスト描画品質を実現します。

Who it’s for

本プロジェクトは、AI 生成画像において高忠実度のテキスト描画が必要だが、計算リソースが限られている、または低レイテンシなインタラクティブ使用が求められる開発者や研究者向けです。

Highlights

  • Compact Scale: 7B パラメータの予算内で 20B クラスのテキスト描画品質を提供。
  • Layout Precision: 様々なフォント、サイズ、アスペクト比にわたり、可読性と意味的一貫性を保ったタイポグラフィを実現。
  • High Deployability: 単一 GPU に収まり、diffusersvllm-omnistable-diffusion.cppComfyUI などの主流フレームワークに統合済み。
  • Strong Performance: CVTG-2K や LongText-Bench といったテキスト描画ベンチマークで、より大きなモデルを上回る性能を示します。