Qwen-VL-Plus 및 Qwen-VL-Max 출시

Qwen은 Qwen-VL 시리즈의 두 가지 향상된 버전인 Qwen-VL-Plus와 Qwen-VL-Max를 소개했습니다. 이 모델들은 이미지 관련 추론, 상세 인식, 그리고 100만 픽셀을 초과하는 고해상도 이미지와 임의의 종횡비를 처리하는 능력을 크게 향상시킵니다.

모델 비교: Qwen-VL-Plus vs. Qwen-VL-Max

Qwen은 성능과 기능 사이의 균형을 맞추기 위해 두 가지 별도 버전의 향상된 시각 언어 모델을 제공합니다:

  • Qwen-VL-Plus: 상세 인식 및 텍스트 인식 능력을 위해 설계된 향상된 대형 시각 언어 모델로, 초고해상도 픽셀과 임의의 종횡비를 지원합니다.
  • Qwen-VL-Max: 시리즈 중 가장 강력한 모델로, 시각적 추론 및 지시 수행 능력을 더욱 향상시켜 고차원 인지 이해와 복잡한 작업을 지원합니다.

성능 벤치마크

Qwen-VL-Plus와 Qwen-VL-Max는 여러 텍스트-이미지 멀티모달 작업에서 Gemini Ultra 및 GPT-4V와 동등한 성능을 보입니다. 특히, Qwen-VL-Max는 중국어 질문 응답 및 중국어 텍스트 이해에서 GPT-4V와 Gemini 모두를 능가합니다.

Model DocVQA ChartQA AI2D TextVQA MMMU MathVista MM-Bench-CN
기타 최고 오픈소스 LVLM 81.6% 68.4% 73.7% 76.1% 45.9% 36.7% 72.4%
Gemini Pro 88.1% 74.1% 73.9% 74.6% 47.9% 45.2% 74.3%
Gemini Ultra 90.9% 80.8% 79.5% 82.3% 59.4% 53.0% -
GPT-4V 88.4% 78.5% 78.2% 78.0% 56.8% 49.9% 73.9%
Qwen-VL-Plus 91.4% 78.1% 75.9% 78.9% 45.2% 43.3% 68.0%
Qwen-VL-Max 93.1% 79.8% 79.3% 79.5% 51.4% 50.0% 75.1%

주요 기술 역량

고해상도 이미지 처리

Qwen-VL-Plus와 Qwen-VL-Max는 100만 픽셀을 초과하는 해상도와 다양한 종횡비의 이미지를 지원하여 이미지와 텍스트 내 세부 사항을 보다 정밀하게 인식할 수 있습니다.

시각적 추론 및 문제 해결

단순한 설명을 넘어, 모델은 흐름도, 다이어그램, 기호 체계와 같은 복잡한 표현을 해석할 수 있습니다. 여기에는 수학 문제 해결 및 차트와 그래프 분석이 포함됩니다.

시각 에이전트 및 로컬라이제이션

모델은 이미지 내 특정 요소를 정확히 찾아내고 질의할 수 있는 능력을 가지고 있습니다. 예를 들어 특정 객체(예: 빨간 차)를 강조하고 장면의 동일한 맥락을 기반으로 결정을 내릴 수 있습니다.

텍스트 정보 인식

Qwen-VL-Plus/Max는 중국어와 영어 텍스트 인식이 크게 향상되었습니다. 문서와 표에서 정보를 효율적으로 추출하고 JSON과 같은 맞춤형 출력 형식으로 재구성하여 밀집 텍스트 처리를 수행할 수 있습니다.

사용 가능 여부

  • Huggingface Spaces: Plus와 Max 버전 모두에 대한 데모.
  • QianWen Web Portal: Qwen-VL-Max용 이미지 이해 모드.
  • Dashscope APIs: 두 모델 모두에 대한 API 접근.

Sources