EvolvingLMMs-Lab/LLaVA-OneVision-2
Fully Open Framework for Democratized Multimodal Training
해결하는 문제
LLaVA-OneVision-2는 단일 아키텍처 내에서 이미지, 장시간 비디오 및 공간 이해를 통합하도록 설계된 멀티모달 모델입니다. 대부분의 오픈 멀티모달 모델이 2D 단일 이미지 작업에 제한되거나, 컨텍스트 윈도우 제약과 비효율적인 토큰 사용으로 인해 장시간 비디오 처리에 어려움을 겪는 한계를 해결합니다.
작동 방식
이 프로젝트는 HEVC 비디오 압축을 모방하는 '코덱 정렬' 비전 인코더(OneVision-Encoder)를 활용합니다. 프레임을 균일하게 샘플링하는 대신, 고밀도 I-프레임을 유지하고 P-프레임에서 움직임 및 잔차가 풍부한 패치만 선택합니다. 이를 통해 동일한 토큰 예산 내에서 표준 샘플링의 3배에 달하는 시간 범위를 커버할 수 있습니다.
중요한 점은, 모델이 이미지, 균일 프레임, 코덱 정렬 토큰 등 모든 모달리티에 대해 공유 위치 스키마를 사용하여 단일 통합 인코더를 활용함으로써, 작업별 어댑터나 별도 토크나이저의 필요성을 제거한다는 것입니다. 학습은 4단계 커리큘럼을 따릅니다: 비디오 능력 부트스트랩, 지시 튜닝, 장시간 비디오로 확장, 공간 및 추적 기술 정제.
대상 사용자
이 프로젝트는 장시간 비디오 추론, 3D 인식 공간 레이아웃 이해, 고해상도 문서 및 OCR 처리가 가능한 고성능의 완전히 오픈된 멀티모달 모델을 필요로 하는 AI 연구자 및 개발자를 위한 것입니다.
하이라이트
- 통합 아키텍처: 작업별 어댑터 없이 이미지, 장시간 비디오, 공간 추론을 처리하는 단일 8B 모델.
- 코덱 정렬 인코딩: 움직임이 풍부한 패치에 초점을 맞춰 장시간 비디오를 효율적으로 처리하고 시간 커버리지를 향상시킵니다.
- 완전한 오픈소스: 인코더 가중치, 학습 코드, 설정, 전체 학습 로그를 포함한 전체 파이프라인을 공개합니다.
- 포괄적인 데이터셋: 고밀도 비디오 캡셔닝 및 3D 인식 공간 추론을 위한 전문 데이터셋을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트