ATH-MaaS/Ovis-Image

Ovis-Image is a 7B text-to-image model specifically optimized for high-quality text rendering, designed to operate efficiently under stringent computational constraints.

What it solves

Ovis-Image 解决了在生成图像中渲染高质量、可读且拼写正确的文字的难题,尤其是在使用更小、更高效的模型时。它专注于对布局敏感的内容,如海报、标志、横幅和 UI 原型,在这些场景中,文字与视觉设计的对齐至关重要。

How it works

Ovis-Image 是一个基于 Ovis-U1 架构的 7B 参数文本生成图像模型。它的体积足以在单张高端 GPU(内存适中)上运行,同时保持与更大 20B 级系统或闭源模型(如 GPT-4o)相当的文字渲染质量。

Who it’s for

本项目面向需要在 AI 生成图像中实现高保真文字渲染的开发者和研究者,且受限于严格的计算资源或需要低延迟交互使用的场景。

Highlights

  • Compact Scale: 在 7B 参数预算内提供 20B 级别的文字渲染质量。
  • Layout Precision: 在各种字体、大小和宽高比下,都能生成可读且语义一致的排版。
  • High Deployability: 可在单张 GPU 上运行,并已集成到 diffusersvllm-omnistable-diffusion.cppComfyUI 等流行框架。
  • Strong Performance: 在 CVTG-2K、LongText-Bench 等文字渲染基准测试中,表现优于多个更大型的模型。