ATH-MaaS/Ovis
A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.
What it solves
Ovis 是一個旨在彌合視覺與文本嵌入之間差距的多模態大語言模型 (MLLM)。它解決了多模態任務中高解析度圖像處理與複雜推理的挑戰,提供了一種將視覺數據與語言模型理解能力進行結構化對齊的方法。
How it works
Ovis 使用了一種新穎的架構,將來自 Vision Transformer (ViT) 的視覺嵌入與大語言模型 (LLM) 的嵌入進行對齊。它支持多種 LLM 骨幹網絡 (例如 Qwen3) 和 ViT 骨幹網絡 (例如 SigLIP2)。最新版本 Ovis2.5 引入了用於反思性推理的「思考模式」,允許模型以原生解析度處理圖像,並處理多圖或影片輸入。
Who it’s for
此專案是為需要高性能開源 MLLM 的 AI 研究人員與開發者設計的,該模型能夠處理 STEM 任務、圖表分析、定位 (grounding) 與影片理解。
Highlights
- Reflective Reasoning: 專用「思考模式」增強了模型執行複雜推理任務的能力。
- Native-Resolution Perception: 能夠以原始解析度處理視覺輸入,以實現更好的細節保留。
- Flexible Architecture: 與多種 LLM 和 ViT 骨幹網絡兼容,模型參數規模從 2B 到 34B 不等。
- Broad Modality Support: 支持單張圖像、多張圖像、影片以及純文本輸入。
- Fine-tuning Support: 包含內置的訓練腳本,並與
ms-swift框架兼容。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch