Qwen-VL-Plus 및 Qwen-VL-Max 출시
Qwen은 Qwen-VL 시리즈의 두 가지 향상된 버전인 Qwen-VL-Plus와 Qwen-VL-Max를 소개했습니다. 이 모델들은 이미지 관련 추론, 상세 인식, 그리고 100만 픽셀을 초과하는 고해상도 이미지와 임의의 종횡비를 처리하는 능력을 크게 향상시킵니다.
모델 비교: Qwen-VL-Plus vs. Qwen-VL-Max
Qwen은 성능과 기능 사이의 균형을 맞추기 위해 두 가지 별도 버전의 향상된 시각 언어 모델을 제공합니다:
- Qwen-VL-Plus: 상세 인식 및 텍스트 인식 능력을 위해 설계된 향상된 대형 시각 언어 모델로, 초고해상도 픽셀과 임의의 종횡비를 지원합니다.
- Qwen-VL-Max: 시리즈 중 가장 강력한 모델로, 시각적 추론 및 지시 수행 능력을 더욱 향상시켜 고차원 인지 이해와 복잡한 작업을 지원합니다.
성능 벤치마크
Qwen-VL-Plus와 Qwen-VL-Max는 여러 텍스트-이미지 멀티모달 작업에서 Gemini Ultra 및 GPT-4V와 동등한 성능을 보입니다. 특히, Qwen-VL-Max는 중국어 질문 응답 및 중국어 텍스트 이해에서 GPT-4V와 Gemini 모두를 능가합니다.
| Model | DocVQA | ChartQA | AI2D | TextVQA | MMMU | MathVista | MM-Bench-CN |
|---|---|---|---|---|---|---|---|
| 기타 최고 오픈소스 LVLM | 81.6% | 68.4% | 73.7% | 76.1% | 45.9% | 36.7% | 72.4% |
| Gemini Pro | 88.1% | 74.1% | 73.9% | 74.6% | 47.9% | 45.2% | 74.3% |
| Gemini Ultra | 90.9% | 80.8% | 79.5% | 82.3% | 59.4% | 53.0% | - |
| GPT-4V | 88.4% | 78.5% | 78.2% | 78.0% | 56.8% | 49.9% | 73.9% |
| Qwen-VL-Plus | 91.4% | 78.1% | 75.9% | 78.9% | 45.2% | 43.3% | 68.0% |
| Qwen-VL-Max | 93.1% | 79.8% | 79.3% | 79.5% | 51.4% | 50.0% | 75.1% |
주요 기술 역량
고해상도 이미지 처리
Qwen-VL-Plus와 Qwen-VL-Max는 100만 픽셀을 초과하는 해상도와 다양한 종횡비의 이미지를 지원하여 이미지와 텍스트 내 세부 사항을 보다 정밀하게 인식할 수 있습니다.
시각적 추론 및 문제 해결
단순한 설명을 넘어, 모델은 흐름도, 다이어그램, 기호 체계와 같은 복잡한 표현을 해석할 수 있습니다. 여기에는 수학 문제 해결 및 차트와 그래프 분석이 포함됩니다.
시각 에이전트 및 로컬라이제이션
모델은 이미지 내 특정 요소를 정확히 찾아내고 질의할 수 있는 능력을 가지고 있습니다. 예를 들어 특정 객체(예: 빨간 차)를 강조하고 장면의 동일한 맥락을 기반으로 결정을 내릴 수 있습니다.
텍스트 정보 인식
Qwen-VL-Plus/Max는 중국어와 영어 텍스트 인식이 크게 향상되었습니다. 문서와 표에서 정보를 효율적으로 추출하고 JSON과 같은 맞춤형 출력 형식으로 재구성하여 밀집 텍스트 처리를 수행할 수 있습니다.
사용 가능 여부
- Huggingface Spaces: Plus와 Max 버전 모두에 대한 데모.
- QianWen Web Portal: Qwen-VL-Max용 이미지 이해 모드.
- Dashscope APIs: 두 모델 모두에 대한 API 접근.
Sources
- OriginalIntroducing Qwen-VL