Qwen3-VL-Embedding 및 Qwen3-VL-Reranker 출시
Qwen은 멀티모달 정보 검색 및 교차 모달 이해를 위해 특별히 설계된 새로운 모델 시리즈인 Qwen3-VL-Embedding 및 Qwen3-VL-Reranker의 출시를 발표했습니다. Qwen3-VL 기반 모델 위에 구축된 이 도구들은 텍스트, 이미지, 스크린샷 및 비디오를 통합 프레임워크 내에서 원활하게 처리하여 멀티모달 콘텐츠 검색의 정확성을 향상시킵니다.
기술 아키텍처
Qwen3-VL-Embedding 및 Qwen3-VL-Reranker는 검색 파이프라인에서 효율성과 정밀성의 균형을 맞추기 위해 서로 다른 아키텍처 접근 방식을 사용합니다.
Qwen3-VL-Embedding (듀얼 타워)
Embedding 모델은 단일 모달 또는 혼합 모달 입력을 고차원 의미 벡터로 매핑하기 위해 듀얼 타워 아키텍처를 사용합니다. 기본 모델의 마지막 레이어에서 [EOS] 토큰의 은닉 상태 벡터를 추출하여 최종 의미 표현으로 활용합니다. 이러한 독립적인 인코딩은 벡터 공간에서 후보를 효율적이고 대규모로 검색할 수 있게 합니다.
Qwen3-VL-Reranker (싱글 타워)
Reranker는 교차 주의(Cross-Attention) 메커니즘을 갖춘 싱글 타워 아키텍처를 사용하여 (쿼리, 문서) 쌍을 공동 인코딩합니다. 쿼리와 문서 간의 상호 작용을 분석함으로써 모델은 특수 토큰(yes 및 no) 생성 확률을 기반으로 정확한 관련성 점수를 출력합니다.
모델 사양
Embedding 및 Reranker 시리즈 모두 2B와 8B 파라미터 크기로 제공됩니다. 모든 모델은 32K 시퀀스 길이를 지원하며, 인스트럭션 인식 기능을 갖추어 입력 인스트럭션을 작업에 맞게 맞춤 설정할 수 있습니다.
| 모델 | 크기 | 레이어 | 시퀀스 길이 | 임베딩 차원 | 양자화 | MRL 지원 |
|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 2B | 28 | 32K | 2048 | 예 | 예 |
| Qwen3-VL-Embedding-8B | 8B | 36 | 32K | 4096 | 예 | 예 |
| Qwen3-VL-Reranker-2B | 2B | 28 | 32K | - | - | - |
| Qwen3-VL-Reranker-8B | 8B | 36 | 32K | - | - | - |
성능 및 벤치마크
Qwen3-VL-Embedding-8B는 MMEB-v2 벤치마크에서 최첨단(SOTA) 결과를 달성하여 기존 오픈소스 및 상용 모델을 능가합니다. 이미지, 시각 문서, 비디오 검색 하위 작업 전반에서 지속적으로 최고 성능을 보입니다.
텍스트 전용 다국어 MMTEB 벤치마크에서는 Qwen3-VL-Embedding 모델이 동일 규모의 다른 모델들과 매우 경쟁력이 있지만, 텍스트 전용 Qwen3-Embedding 모델에 비해 성능 격차가 존재합니다.
Reranker 평가
Qwen3-VL-Reranker 모델은 JinaVDR 및 ViDoRe v3를 포함한 다양한 데이터셋에서 기본 Embedding 모델 및 기존 Reranker를 지속적으로 능가합니다. 8B 변형은 대부분의 작업에서 가장 높은 성능을 제공합니다.
| 모델 | MMEB-v2 (평균) | MMEB-v2 (이미지) | MMEB-v2 (비디오) | MMEB-v2 (시각문서) | MMTEB | JinaVDR | ViDoRe (v3) |
|---|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 73.4 | 74.8 | 53.6 | 79.2 | 68.1 | 71.0 | 52.9 |
| jina-reranker-m0 | - | 68.2 | - | 85.2 | - | 82.2 | 57.8 |
| Qwen3-VL-Reranker-2B | 75.1 | 73.8 | 52.1 | 83.4 | 70.0 | 80.9 | 60.8 |
| Qwen3-VL-Reranker-8B | 79.2 | 80.7 | 55.8 | 86.3 | 74.9 | 83.6 | 66.7 |
검색 파이프라인에서의 구현
최적의 결과를 위해 Embedding 및 Reranker 모델은 두 단계 검색 프로세스에서 사용됩니다:
- 초기 리콜: Qwen3-VL-Embedding 모델은 벡터 공간에서 광범위한 후보 집합을 효율적으로 검색합니다.
- 정제된 랭킹: Qwen3-VL-Reranker 모델은 공동 인코딩을 사용해 이러한 후보들을 정렬하여 가장 정확한 최종 결과를 제공합니다.
이 결합된 접근 방식은 확장성을 위한 Embedding 모델의 효율성과 세밀한 정렬을 위한 Reranker의 정밀성을 활용합니다.