ATH-MaaS/Ovis

A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.

What it solves

Ovisは、視覚とテキストの埋め込みの間のギャップを埋めるために設計されたマルチモーダル大規模言語モデル (MLLM) です。マルチモーダルタスクにおける高解像度画像処理と複雑な推論の課題に対処し、視覚データを言語モデルの理解力と構造的に整列させる方法を提供します。

How it works

Ovisは、Vision Transformer (ViT) からの視覚的埋め込みを、大規模言語モデル (LLM) の埋め込みと整列させる新しいアーキテクチャを使用しています。Qwen3 などの様々な LLM バックボーンと、SigLIP2 などの ViT バックボーンをサポートしています。最新バージョンである Ovis2.5 は、反思的な推論のための "thinking mode" を導入し、モデルがネイティブ解像度で画像を処理し、マルチイメージまたはビデオ入力に対応することを可能にします。

Who it’s for

このプロジェクトは、STEM タスク、チャート分析、グラウンディング、ビデオ理解を扱うことができる高性能なオープンソース MLLM を必要とする AI 研究者や開発者向けです。

Highlights

  • Reflective Reasoning: モデルの複雑な推論タスクを実行する能力を強化する専用の "thinking mode"。
  • Native-Resolution Perception: 細部をより良く保持するために、画像をオリジナル解像度で処理する能力。
  • Flexible Architecture: 2B から 34B パラメータのモデル範囲を提供し、複数の LLM および ViT バックボーンと互換性があります。
  • Broad Modality Support: 単一の画像、複数の画像、複数のビデオ、および純粋なテキスト入力に対応しています。
  • Fine-tuning Support: 内蔵のトレーニングスクリプトと ms-swift フレームワークとの互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch