Qwen2.5-VL-32B 릴리스 노트

Qwen은 Qwen2.5-VL-32B-Instruct를 출시했습니다. 이 모델은 강화 학습을 활용하여 수학적 추론 및 이미지 이해를 향상시키는 비전-언어(VL) 모델입니다. 모델은 Apache 2.0 라이선스 하에 오픈 소스로 제공됩니다.

주요 개선 사항 및 기능

Qwen2.5-VL-32B-Instruct는 이전 Qwen2.5-VL 시리즈 모델에 비해 세 가지 주요 최적화를 도입합니다:

  • Human Preference Alignment: 출력 스타일이 조정되어 보다 상세하고 형식이 잘 갖춰진 답변을 제공하며, 인간 선호도와 더 가깝게 일치합니다.
  • Enhanced Mathematical Reasoning: 복잡한 수학 문제를 해결할 때 정확도가 크게 향상되었습니다.
  • Fine-grained Image Understanding: 이미지 파싱, 내용 인식 및 시각 논리 추론과 관련된 작업에서 정확도와 상세 분석이 향상되었습니다.

성능 벤치마크

Qwen2.5-VL-32B-Instruct는 Mistral-Small-3.1-24B 및 Gemma-3-27B-IT와 같은 유사 모델에 비해 우수성을 보여줍니다. 특히, 여러 핵심 영역에서 더 큰 Qwen2-VL-72B-Instruct를 능가합니다:

  • Multimodal Reasoning: 복잡하고 다단계 추론에 초점을 맞춘 벤치마크, 특히 MMMU, MMMU-Pro, MathVista에서 모델이 상당한 이점을 확보합니다.
  • User Experience: 주관적 사용자 경험을 평가하는 MM-MT-Bench에서 Qwen2.5-VL-32B-Instruct는 Qwen2-VL-72B-Instruct보다 크게 앞섭니다.
  • Text Capabilities: 동일 규모의 다른 모델에 비해 순수 텍스트 능력에서도 최고 수준의 성능을 달성합니다.

실전 시각 추론

모델의 능력은 시각 데이터와 논리·수학적 단계를 통합해야 하는 복잡한 시각 작업을 통해 입증됩니다:

  • Visual Logic Deduction: 운전 상황에서 모델은 제한 속도 표지판(트럭용 100 km/h)을 식별하고, 특정 거리(110 km)의 이동 시간을 계산하며, 목적지에 특정 시간 내에 도달할 수 있는지를 판단합니다.
  • Geometric Reasoning: 모델은 이미지에서 교차선과 각도 이등분선을 분석하여 특정 각도 값을 계산함으로써 기하학 문제를 해결할 수 있습니다.
  • Detailed Image Parsing: 모델은 이미지 내의 특정 문화적 표식(예: 빨간 고추와 사천 후추 베이스, 분할된 냄비 디자인)을 식별하여 해당 요리를 사천 매운 전골로 정확히 판별합니다.

향후 연구 방향

Qwen2.5-VL-32B는 "빠른 사고" 패러다임을 통해 주관적 경험과 수학적 추론을 최적화하는 데 중점을 두고 있지만, Qwen 팀은 다음 연구 우선순위가 길고 효과적인 추론 과정이 될 것이라고 밝혔습니다. 이 방향은 고도로 복잡하고 다단계 시각 추론 작업을 해결하는 데 있어 시각 모델의 한계를 확장하는 것을 목표로 합니다.

Sources