SmolVLM2: 모든 기기에 비디오 이해를 제공
Hugging Face는 효율적인 멀티모달 모델 시리즈인 SmolVLM2를 소개했습니다. 이 모델들은 로컬 디바이스에서 비디오 및 이미지 이해를 제공하도록 설계되었습니다. 2.2B, 500M, 256M 파라미터의 세 가지 크기로 모델을 출시함으로써, SmolVLM2는 massive computing resources 없이 모바일 폰부터 서버까지의 하드웨어에서 고성능 시각 분석을 가능하게 합니다.
모델 변형 및 성능
SmolVLM2는 성능과 메모리 소비를 균형 있게 맞출 수 있는 세 가지 구분되는 모델 크기를 제공하며, 500M과 256M 버전은 현재까지 출시된 가장 작은 비디오 언어 모델을 나타냅니다.
SmolVLM2 2.2B
2.2B 모델은 일반 전 및 비디오 작업에 대한 주요 선택지입니다. 이전 SmolVLM 가족보다 몇 가지 핵심 영역에서 상당한 향상을 보여줍니다:
- Mathematical Reasoning: 이미지를 사용하여 수학 문제를 해결하는 능력이 향상되었습니다.
- OCR and Diagrams: 사진에서 텍스트 읽기 및 복잡한 다이어그램 이해가 향상되었습니다.
- Scientific QA: 과학적 시각 질문에 대한 성능이 향상되었습니다.
Video-MME 벤치마크에서, 2.2B 모델은 2B 파라미터 범위의 모든 기존 모델보다 성능이 뛰어납니다. 메모리 효율성 덕분에 Google Colab의 무료 티어에서 실행할 수 있습니다.
SmolVLM2 500M 및 256M
500M 모델은 파라미터의 4분의 1 미만을 사용하면서도 2.2B 모델과 매우 가까운 비디오 이해 능력을 제공합니다. 256M 모델은 비디오를 처리할 수 있는 모델이 얼마나 작을 수 있는지의 경계를 넓히려는 실험적 출시물로, 특화된 파인튜닝 및 창의적 애플리케이션의 기초 역할을 합니다.
실제 응용 및 데모
소규모 비디오 모델의 유용성을 보여주기 위해, Hugging Face는 세 가지 특정 애플리케이션을 개발했습니다.
- iPhone Video Understanding: 500M 모델을 사용하는 로컬 애플리케이션으로, 클라우드 연결 없이 디바이스에서 직접 비디오 콘텐츠를 분석합니다.
- VLC Media Player Integration: VLC와의 협업을 통해 비디오 내에서 의미적 검색 및 탐색을 가능하게 하여, 사용자가 자연 언어 설명에 기반한 특정 섹션으로 이동할 수 있도록 합니다.
- Video Highlight Generator: 1시간 이상의 긴 형식의 비디오(예: 축구 경기)를 처리하여 가장 중요한 순간을 자동으로 추출할 수 있는 도구입니다.
기술적 구현 및 배포
SmolVLM2는 출시 시부터 transformers 라이브러리와 Apple Silicon 최적화를 위한 MLX와 통합되었습니다.
Transformers 통합
추론은 chat 템플릿을 사용하는 대화형 API를 통해 처리됩니다. 모델은 다음을 지원합니다:
- Video Inference: `{