OpenGVLab/InternVideo

[ECCV2024] Video Foundation Models & Data for Multimodal Understanding

해결하는 문제

InternVideo는 기계가 비디오 콘텐츠를 이해하고 추론하는 방식을 개선하기 위해 설계된 일련의 파운데이션 모델을 제공합니다. 이는 멀티모달 이해의 확장성 문제를 해결하여 AI가 긴 시간 범위의 비디오 데이터를 처리하고 복잡한 문맥 추론을 수행할 수 있도록 합니다.

작동 방식

이 프로젝트는 일련의 반복을 통해 진화합니다:

  • InternVideo (v1): 일반적인 비디오 파운데이션 모델을 위해 생성 및 판별 학습을 사용합니다.
  • InternVideo2: 이러한 모델을 확장하여 더 나은 멀티모달 비디오 이해를 구현합니다.
  • InternVideo2.5: 비디오 멀티모달 대규모 언어 모델(MLLM)을 위한 길고 풍부한 문맥 모델링에 집중합니다.
  • InternVideo3: 멀티모달 문맥 추론을 위한 효율적인 장기 에이전트를 구현합니다.
  • InternVideo-Next: 일반적인 비디오 파운데이션 모델을 통해 진정한 세계 이해를 목표로 합니다.

이 프로젝트는 이해와 생성 모두에 사용되는 대규모 비디오-텍스트 데이터셋인 InternVid에 의해 지원됩니다.

대상

이 프로젝트는 주로 비디오 이해, 멀티모달 학습 및 비디오 중심 AI 에이전트 개발을 연구하는 AI 연구자 및 엔지니어를 대상으로 합니다.

주요 특징

  • 반복적인 모델 시리즈: 일반적인 파운데이션 모델에서 특화된 긴 문맥 및 에이전트 추론 모델로의 발전.
  • 대규모 데이터: 최대 2억 3천만 개의 비디오-텍스트 쌍을 포함하는 InternVid 데이터셋 포함.
  • 다양한 모델 크기: 효율성을 위해 증류된 소형 버전(S/B/L)을 포함한 다양한 모델 규모 제공.
  • 에이전트 통합: 최신 버전은 복잡한 추론 작업을 위한 장기 에이전트를 통합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트