NVlabs/OmniVinci
OmniVinci is an omni-modal LLM for joint understanding of vision, audio, and language.
What it solves
OmniVinci는 단일 대규모 언어 모델(LLM) 내에서 여러 모달리티(특히 시각, 오디오, 텍스트)의 공동 이해를 향상시키기 위해 설계되었습니다. 소리와 시각 같은 서로 다른 감각 입력을 정렬하는 문제를 해결하여, 모델이 이들을 동시에 추론할 수 있게 합니다. 이는 로보틱스, 의료 AI, 스마트 팩토리 분야의 응용에 필수적입니다.
How it works
OmniVinci는 특화된 아키텍처와 2,400만 개의 싱글 모달 및 멀티모달 대화 데이터셋을 큐레이션하여 목표를 달성합니다. 세 가지 주요 아키텍처 혁신을 도입합니다:
- OmniAlignNet: 공유 잠재 공간에서 시각과 오디오 임베딩(embeddings) 간의 정렬을 강화합니다.
- Temporal Embedding Grouping: 시각과 오디오 신호 사이의 상대적 시간적 정렬을 포착합니다.
- Constrained Rotary Time Embedding: 절대적 시간 정보를 멀티모달 임베딩(embeddings)에 인코딩합니다.
Who it’s for
이 프로젝트는 고성능 크로스 모달 이해가 필요한 멀티모달 시스템을 구축하는 AI 연구자 및 개발자를 위한 것입니다. 특히 비디오와 오디오 통합 작업을 수행하는 분들에게 적합합니다.
Highlights
- High Efficiency: 여러 벤치마크(DailyOmni, MMAR, Video-MME)에서 Qwen2.5-Omni를 능가하며, 학습에 사용된 토큰(tokens) 수는 6배 더 적습니다 (0.2T vs 1.2T).
- Omni-Modal Support: 시각, 오디오, 텍스트를 공동으로 처리합니다.
- Open Source: 오픈소스 모델(OmniVinci-9B) 및 코드베이스를 제공합니다.
- Broad Application: 로보틱스, 의료 AI, 스마트 팩토리 환경에서의 유용성을 입증했습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트