Qwen2.5-VL 출시 노트
Qwen은 Qwen2.5-VL의 출시를 발표했으며, 이는 Qwen2-VL보다 상당한 발전을 나타내는 주력 비전-언어 모델입니다. 이 모델은 3B, 7B, 72B 세 가지 크기로 제공되며, Hugging Face와 ModelScope를 통해 베이스 및 인스트럭트 버전이 모두 제공됩니다.
주요 기능 및 특징
Qwen2.5-VL은 복잡한 시각적 추론과 에이전트 행동을 위해 설계된 여러 고급 기능을 도입합니다:
- Visual Agentic Behavior: 이 모델은 추론이 가능하고 컴퓨터 및 전화 사용을 위한 도구를 동적으로 지시할 수 있는 시각적 에이전트로 작동할 수 있습니다.
- Long Video Comprehension: Qwen2.5-VL은 1시간을 초과하는 비디오를 지원하며, 관련 비디오 세그먼트를 식별하여 특정 사건을 정확히 파악할 수 있습니다.
- Structured Output Generation: 이 모델은 송장, 양식, 테이블의 스캔으로부터 구조화된 데이터(예: JSON)를 생성하여 상업 및 금융 분야에서의 활용을 용이하게 합니다.
- Visual Localization: 이 모델은 경계 상자 또는 점을 사용하여 객체를 정확하게 위치시킬 수 있으며, 좌표 및 속성에 대한 안정적인 JSON 출력을 제공합니다.
- Advanced Visual Understanding: 이 모델은 일반적인 객체를 인식하는 데 능숙하며, 복잡한 텍스트, 차트, 아이콘, 그래픽 및 레이아웃을 분석할 수 있습니다.
성능 벤치마크
Qwen2.5-VL은 대학 수준 문제, 수학, 문서 이해, 비디오 분석 등을 포함한 다양한 분야에서 경쟁력 있는 성능을 보여줍니다.
- Flagship Model (72B-Instruct): 최첨단(SOTA) 경쟁 성능을 달성하며, 다이어그램과 문서 이해에서 상당한 장점을 보입니다. 작업별 파인튜닝 없이도 시각적 에이전트로 기능할 수 있습니다.
- Mid-size Model (7B-Instruct): 여러 작업에서 GPT-4o-mini보다 우수한 성능을 보입니다.
- Edge AI Solution (3B): 이전 Qwen2-VL 버전의 7B 모델보다 우수한 성능을 보입니다.
기술적 심층 탐구: 모델 기능
문서 파싱 및 텍스트 인식
Qwen2.5-VL은 다국어, 다방향, 다시나리오 텍스트 인식에서 성능이 향상된 업그레이드된 OCR 기능을 제공합니다. 주요 혁신은 QwenVL HTML format로, HTML 기반 레이아웃 정보를 추출하는 독특한 문서 파싱 형식으로, 이를 통해 모델은 잡지, 연구 논문, 웹 페이지 및 모바일 스크린샷을 파싱할 수 있습니다.
객체 grounding 및 이미지 인식
이 모델은 grounding을 위해 경계 상자와 점 기반 표현을 활용하여 계층적 위치를 가능하게 합니다. 이미지 인식은 식물, 동물, 랜드마크, 영화/TV IP, 다양한 상업 제품 등을 포함한 광범위한 카테고리로 확장되었습니다.
비디오 처리
시간적 처리를 향상시키기 위해 Qwen2.5-VL은 동적 프레임 레이트(FPS) 훈련과 절대 시간 인코딩을 구현합니다. 이를 통해 모델은 초 단위 사건 위치를 달성하고 시간 단위 비디오에서 핵심 포인트를 요약할 수 있습니다.
아키텍처 개선
Qwen2-VL과 비교하여 Qwen2.5-VL은 모델이 공간 및 시간 척도를 인식하는 방식을 최적화하고 시각 인코더를 간소화하여 효율성을 높였습니다.
공간 및 시간 인식
- Spatial: 이 모델은 다양한 크기의 이미지를 길이가 다른 토큰으로 동적으로 변환합니다. 전통적인 좌표 정규화 대신 이미지의 실제 크기 스케일을 사용하여 좌표(감지 박스 및 점)를 표현함으로써 모델은 이미지 스케일을 직접 학습할 수 있습니다.
- Temporal: 동적 FPS 훈련과 절대 시간 인코딩은 mRoPE ids를 시간의 속도와 맞춰서 모델이 시간 차원 id 간격을 통해 시간의 흐름을 학습할 수 있게 합니다.
시각 인코더 최적화
Qwen은 처음부터 네이티브 동적 해상도 ViT를 훈련했습니다. 계산 부하를 줄이고 부하 불균형을 해결하기 위해 모델은 대부분의 레이어에 Window Attention(최대 창 크기 8x8)을 적용하고, 나머지 네 레이어에만 Full Attention을 예약합니다. 또한 ViT 아키텍처는 LLMs와의 일관성을 유지하기 위해 RMSNorm과 SwiGLU 구조를 사용하도록 업데이트되었습니다.