NVlabs/OmniVinci

OmniVinci is an omni-modal LLM for joint understanding of vision, audio, and language.

What it solves

OmniVinci 旨在提升单个大语言模型 (LLM) 对多种模态的共同理解能力——特别是在视觉、音频、文本方面。它解决了对齐不同感官输入(如声音与视觉)的挑战,使得模型能够同时对它们进行推理,这对于机器人、医疗 AI 和智能工厂的应用至关重要。

How it works

OmniVinci 利用专门的架构与包含 2400 万条单模态与全模态对话的精选数据集来达成其目标。它引入了三项主要的架构创新:

  • OmniAlignNet: 强化了共享潜空间中的视觉与音频嵌入 (embeddings) 的对齐。
  • Temporal Embedding Grouping: 捕捉视觉与音频信号之间的相对时间对齐。
  • Constrained Rotary Time Embedding: Encoders 绝对时间信息到全模态嵌入 (embeddings) 中。

Who it’s for

该项目旨在为正在构建需要高性能跨模态理解能力的 AI 研究人员与开发者,特别是那些从事视频与音频整合的工作人员。

Highlights

  • High Efficiency: 在多项基准测试 (DailyOmni, MMAR, Video-MME) 中表现优于 Qwen2.5-Omni,同时使用的训练令牌 (tokens) 数量仅为后者的 6 倍之少 (0.2T vs 1.2T)。
  • Omni-Modal Support: 共同处理视觉、音频、文本。
  • Open Source: 提供开源模型 (OmniVinci-9B) 与代码库。
  • Broad Application: 已在机器人、医疗 AI 和智能工厂环境中展示了实用性。

相关

  • 项目
  • 项目
  • 项目
  • 项目