ATH-MaaS/Ovis

A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.

What it solves

Ovis는 시각적 임베딩과 텍스트 임베딩 사이의 간극을 메우기 위해 설계된 멀티모달 대규모 언어 모델 (MLLM)입니다. 멀티모달 작업에서 고해상도 이미지 처리 및 복잡한 추론의 과제를 해결하며, 시각적 데이터를 언어 모델의 이해 능력과 구조적으로 정렬하는 방법을 제공합니다.

How it works

Ovis는 Vision Transformer (ViT)의 시각적 임베딩을 대규모 언어 모델 (LLM)의 임베딩과 정렬하는 새로운 아키텍처를를 사용합니다. Qwen3와 같은 다양한 LLM 백본과 SigLIP2와 같은 ViT 백본을 지원합니다. 최신 버전인 Ovis2.5는 반사적 추론을 위한 "thinking mode"를 도입하여, 모델이 네이티브 해상도로 이미지를 처리하고 멀티 이미지 또는 비디오 입력을 처리할 수 있게 합니다.

Who it’s for

이 프로젝트는 STEM 과제, 차트 분석, 그라운딩(grounding), 비디오 이해를 처리할 수 있는 고성능 오픈소스 MLLM이 필요한 AI 연구자 및 개발者입니다.

Highlights

  • Reflective Reasoning: 모델의 복잡한 추론 작업을 수행하는 능력을 향상시키는 전용 "thinking mode".
  • Native-Resolution Perception: 세부 사항을 더 잘 보존하기 위해 시각적 입력을 원래 해상도로 처리하는 능력.
  • Flexible Architecture: 2B에서 34B 파라미터에 이르는 다양한 LLM 및 ViT 백본과 호환됩니다.
  • Broad Modality Support: 단일 이미지, 여러 이미지, 비디오, 그리고 순수 텍스트 입력을 처리합니다.
  • Fine-tuning Support: 内蔵된 트레이닝 스크립트와 ms-swift 프레임워크와의 호환성을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch