NVlabs/OmniVinci

OmniVinci is an omni-modal LLM for joint understanding of vision, audio, and language.

What it solves

OmniVinci 旨在提升單一大型語言模型 (LLM) 對多種模態的共同理解能力——特別是視覺、音訊與文本。它解決了對齊不同感官輸入(如聲音與視覺)的挑戰,使模型能夠同時對其進行推理,這對於機器人、醫療 AI 與智慧工廠的應用至關重要。

How it works

OmniVinci 利用專門的架構與包含 2400 萬條單模態與全模態對話的精選數據集來達成其目標。它引入了三項主要的架構創新:

  • OmniAlignNet: 在共享潛在空間中強化視覺與音訊嵌入 (embeddings) 的對齊。
  • Temporal Embedding Grouping: 捕捉視覺與音訊訊號之間的相對時間對齊。
  • Constrained Rotary Time Embedding: 將絕對時間資訊編碼至全模態嵌入 (embeddings) 中。

Who it’s for

此專案旨在提供給正在開發需要高效能跨模態理解能力的技術人員,特別是處理影片與音訊整合的 AI 研究人員與開發者。

Highlights

  • High Efficiency: 在多項基準測試 (DailyOmni, MMAR, Video-MME) 中表現優於 Qwen2.5-Omni,同時使用的訓練令牌 (tokens) 數量僅為其 6 倍之少 (0.2T vs 1.2T)。
  • Omni-Modal Support: 共同處理視覺、音訊與文本。
  • Open Source: 提供開源模型 (OmniVinci-9B) 與程式碼庫。
  • Broad Application: 已在機器人、醫療 AI 與智慧工廠環境中展示了實用性。

相關

  • 專案
  • 專案
  • 專案
  • 專案