ATH-MaaS/Ovis-Image
Ovis-Image is a 7B text-to-image model specifically optimized for high-quality text rendering, designed to operate efficiently under stringent computational constraints.
What it solves
Ovis-Image는 생성된 이미지 내에서 고품질이며 가독성이 좋고 철자가 정확한 텍스트를 렌더링하는 어려움을 해결합니다. 특히 더 작고 계산 효율이 높은 모델을 사용할 때 이 문제가 두드러집니다. 포스터, 로고, 배너, UI 목업 등 텍스트와 시각 디자인의 정렬이 중요한 레이아웃 민감 콘텐츠를 목표로 합니다.
How it works
Ovis-Image는 Ovis-U1 아키텍처를 기반으로 한 7B 파라미터 텍스트‑투‑이미지 모델입니다. 중간 정도 메모리를 가진 고성능 GPU 한 대에서 실행될 수 있을 만큼 컴팩트하면서도, 20B급 시스템이나 GPT-4o와 같은 클로즈드 소스 모델에 버금가는 텍스트 렌더링 품질을 유지합니다.
Who it’s for
이 프로젝트는 AI 생성 이미지에서 고충실도 텍스트 렌더링이 필요하지만, 엄격한 계산 자원 제한이 있거나 낮은 지연 시간의 인터랙티브 사용이 요구되는 개발자와 연구자를 위한 것입니다.
Highlights
- Compact Scale: 7B 파라미터 예산 내에서 20B급 텍스트 렌더링 품질을 제공합니다.
- Layout Precision: 다양한 폰트, 크기, 종횡비에 걸쳐 가독성 높고 의미적으로 일관된 타이포그래피를 구현합니다.
- High Deployability: 단일 GPU에 탑재 가능하며
diffusers、vllm-omni、stable-diffusion.cpp、ComfyUI등 주요 프레임워크에 통합되어 있습니다. - Strong Performance: CVTG-2K 및 LongText-Bench와 같은 텍스트 렌더링 벤치마크에서 더 큰 모델들을 능가하는 성능을 보여줍니다.