ATH-MaaS/Ovis

A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.

What it solves

Ovis 是一个旨在弥合视觉与文本嵌入之间差距的多模态大语言模型 (MLLM)。它解决了多模态任务中高分辨率图像处理与复杂推理的挑战,提供了一种将视觉数据与语言模型理解能力进行结构化对齐的方法。

How it works

Ovis 使用了一种新颖的架构,将来自 Vision Transformer (ViT) 的视觉嵌入与大语言模型 (LLM) 的嵌入进行对齐。它支持多种 LLM 骨干网络 (例如 Qwen3) 和 ViT 骨干网络 (例如 SigLIP2)。最新版本 Ovis2.5 引入了用于反思性推理的 "thinking mode",允许模型以原生分辨率进行图像处理,并处理多图或视频输入。

Who it’s for

此项目是为需要高性能开源 MLLM 的 AI 研究人员与开发者设计的,该模型能够处理 STEM 任务、图表分析、定位 (grounding) 与视频理解。

Highlights

  • Reflective Reasoning: 专用的 "thinking mode" 增强了模型执行复杂推理任务的能力。
  • Native-Resolution Perception: 能够以原始分辨率处理视觉输入,以实现更好的细节保留。
  • Flexible Architecture: 支持多种 LLM 和 ViT 骨干网络,模型参数规模从 2B 到 34B 不等。
  • Broad Modality Support: 支持单张图像、多张图像、视频以及纯文本输入。
  • Fine-tuning Support: 包含内置的训练脚本,并与 ms-swift 框架兼容。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • Dispatch