OpenGVLab/VideoChat-Flash
[ICLR2026] VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
해결하는 문제
VideoChat-Flash는 최대 3시간에 이르는 초장시간 동영상을 처리하면서도 높은 추론 속도와 정확도를 유지하는 문제를 해결합니다. 장문맥 동영상 모델링에서의 계산 비효율성을 줄이기 위해 동영상 프레임을 표현하는 데 필요한 토큰 수를 감소시킵니다.
작동 방식
이 프로젝트는 각 동영상 프레임을 단지 16개의 토큰으로 인코딩하는 계층적 압축 아키텍처를 구현합니다. 이 방식은 최대 10,000개의 프레임을 처리할 수 있게 하며, 이전 버전보다 5~10배 더 빠릅니다. 동영상 인코더(InternVideo)와 대규모 언어 모델(Qwen)을 기반으로 구축되었습니다.
대상 사용자
이 모델은 장시간 동영상 이해, 시간적 위치 탐지, 고효율 동영상 분석에 특화된 다중모달 대규모 언어 모델(MLLM) 개발 및 연구에 종사하는 연구자와 개발자에게 적합합니다.
주요 특징
- 초장시간 문맥 지원: 최대 3시간 길이의 동영상을 처리할 수 있습니다.
- 고효율성: 프레임을 16개 토큰으로 압축하여 추론 속도를 크게 향상시킵니다.
- 강력한 검색 성능: 10,000개 프레임에서 "바늘 찾기" 평가에서 99.1%의 정확도를 달성합니다.
- 다양한 모델 옵션: 2B 및 7B 크기의 여러 모델과 초장시간 동영상 입력용 또는 단기 시간적 이해용 전용 버전을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트