NVlabs/OmniVinci

OmniVinci is an omni-modal LLM for joint understanding of vision, audio, and language.

What it solves

OmniVinciは、単一の大規模言語モデル (LLM) 内で、複数のモダリティ(特に視覚、音声、テキスト)の統合的な理解を向上させるために設計されています。音や視覚のような異なる感覚入力を整列させるという課題に対処し、モデルがそれらを同時に推論できるようにします。これは、ロボティクス、医療AI、スマートファクトリーへの応用において極めて重要です。

How it works

OmniVinciは、専用のアーキテクチャと、2400万件のシングルモーダルおよび全モーダル対話を含む精選データセットを使用して、その目標を達成します。主に3つのアーキテクチャ上の革新を導入しています:

  • OmniAlignNet: 共有潜在空間における視覚と音声の埋め込み (embeddings) の整列を強化します。
  • Temporal Embedding Grouping: 視覚と音声信号の相対的な時間的整列を捉えます。
  • Constrained Rotary Time Embedding: 絶対的な時間情報を全モーダル埋め込み (embeddings) にエンコードします。

Who it’s for

このプロジェクトは、特にビデオと音声の統合に取り組む、高性能なクロスモーダル理解を必要とする全モーダル・システムを構築するAI研究者や開発者向けです。

Highlights

  • High Efficiency: 複数のベンチマーク (DailyOmni, MMAR, Video-MME) で Qwen2.5-Omni を凌駕し、トレーニング・トークン数を 6 倍少なく抑えています (0.2T vs 1.2T)。
  • Omni-Modal Support: 視覚、音声、テキストを統合的に処理します。
  • Open Source: オープンソースのモデル (OmniVinci-9B) とコードベースを提供します。
  • Broad Application: ロボティクス、医療AI、スマートファクトリー環境での有用性が実証されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト