Aya Vision: 8B 및 32B 모델로 다언어 멀티모달리티 발전
Cohere For AI는 8B 및 32B 파라미터 오픈 웨이트 비전-언어 모델(VLMs)로 구성된 Aya Vision 제품군을 출시했으며, 이는 23개 다양한 언어에 고성능 멀티모달 기능을 제공하도록 설계되었습니다. 이러한 모델은 다언어 비전-언어 작업에서 여러 더 큰 경쟁 모델보다 뛰어난 성능을 보이며, 다양한 언어 범위에서 이미지 이해 및 텍스트 생성을 위한 강력한 기반을 제공합니다.
성능 벤치마크
Aya Vision 모델은 두 가지 주요 벤치마크인 AyaVisionBench와 mWildVision에서 유사한 크기와 훨씬 더 큰 모델보다 뛰어난 성능을 보여줍니다.
Aya Vision 32B
Aya Vision 32B는 자신의 크기의 두 배 이상인 모델보다 뛰어난 성능을 보입니다. 쌍별 비교에서 AyaVisionBench에서 승률이 50%에서 64% 사이, mWildVision에서 52%에서 72% 사이(23개 언어 평균)를 기록하며 다음 모델들에 대해 우위를 보입니다:
- Llama-3.2 90B Vision
- Molmo 72B
- Qwen2.5-VL 72B
Aya Vision 8B
Aya Vision 8B는 자신의 파라미터 클래스를 이끄는 컴팩트하고 효율적인 모델로 자리매김하고 있습니다. Qwen2.5-VL 7B, Pixtral 12B, Gemini Flash 1.5 8B, Llama-3.2 11B Vision, Molmo-D 7B, Pangea 7B 등의 모델보다 뛰어난 성능을 보이며, AyaVisionBench에서 최대 79%, mWildBench에서 최대 81%의 승률을 달성합니다.
아키텍처 및 훈련 파이프라인
Aya Vision은 임의의 해상도를 가진 이미지를 처리하기 위해 비전 인코더, 커넥터, 다언어 텍스트 디코더를 결합한 모듈러 아키텍처를 활용합니다.
비전 처리 및 토큰 압축
모델은 비전 인코더로 SigLIP2-patch14-384를 사용합니다. 고해상도 이미지를 처리하기 위해 시스템은 이미지를 동적으로 크기 조정하고 여러 타일로 분할합니다. 효율성을 유지하고 지연을 줄이기 위해 Pixel Shuffle 다운샘플링 방법을 사용하여 LLM 디코더에 전달하기 전에 이미지 토큰 수를 4배 압축합니다.
텍스트 디코더 초기화
- Aya Vision 8B: Cohere Command R7B에서 초기화되고, 다양한 다언어 데이터, 모델 병합, 선호도 훈련을 포함하는 Aya Expanse 레시피를 사용하여 후속 훈련됩니다.
- Aya Vision 32B: Aya Expanse 32B에서 초기화되어 최첨단 다언어 성능을 활용합니다.
두 단계 훈련 프로세스
- Vision-Language Alignment: 비전 인코더와 언어 모델 가중치는 동결된 상태에서 비전-언어 커넥터만 훈련됩니다.これにより、이미지 인코더 특징이 언어 모델 임베딩 공간에 매핑됩니다.
- Supervised Fine-Tuning (SFT): 커넥터와 언어 모델 모두 23개 언어에 걸친 다양한 멀티모달 작업에서 훈련됩니다.
다언어 데이터 강화
저대표 언어를 위한 실제 세계 멀티모달 데이터의 부족을 극복하기 위해, Cohere For AI는 합성 데이터 파이프라인을 구현했습니다:
- Synthetic Annotation: 고품질 영어 데이터셋을 사용하여 합성 주석을 생성했습니다.
- Translation and Rephrasing: 데이터는 23개 언어로 번역된 후, 번역 아티팩트를 제거하고 언어적 유창성을 보장하기 위해 재구성했습니다.
이 접근 방식은 성능을 크게 향상시켰습니다; 8B 모델의 경우, 합성 주석과 확장된 다언어 데이터를 사용함으로써 Pangea 7B에 대한 승률이 AyaVisionBench에서 40.9%에서 58.1%로 증가했습니다(17.2% 향상).
멀티모델 모델 병합
모델이 비전 이해를 얻으면서도 높은 품질의 대화 및 생성 능력을 유지하도록 보장하기 위해, Cohere For AI는 기본 언어 모델과 미세 조정된 비전-언어 모델을 병합했습니다. 이 기술은 Pangea 7B에 대한 AyaVisionBench에서의 멀티모달 승률을 11.9% 향상시켜 총 승률 70%를 달성했습니다.
또한, 멀티모델 모델 병합은 Aya Vision 모델이 다른 선도적인 VLMs에 비해 mArenaHard 데이터셋으로 측정한 텍스트 전용 작업에서 뛰어난 성능을 발휘하도록 허용합니다.
AyaVisionBench: 새로운 다언어 벤치마크
Cohere For AI는 AyaVisionBench를 출시했는데, 이는 언어당 135개의 이미지-질문 쌍을 가진 23개 언어와 9개 작업 카테고리를 포괄하는 개방형 비전-언어 벤치마크입니다. 이 벤치마크는 다음과 같은Capabilities을 평가합니다:
- 이미지 캡셔닝 및 OCR
- 차트 및 도형 이해
- 문서 이해 및 텍스트 전사
- 논리 및 수학적 추론
- 스크린샷을 코드로 변환
- 두 이미지 간의 차이 식별
- 일반적인 시각적 질문 답변 데이터 세트는 훈련 누출을 방지하기 위해 Cauldron held-out 테스트 세트의 이미지를 사용하여 생성되었습니다. 질문은 합성적으로 생성된 후 인간 주석가에 의해 검증되어 시각적 컨텍스트에 truly 의존함을 보장했습니다.
실제 세계 응용
Aya Vision은 글로벌 접근성을 위해 설계되었으며 현재 WhatsApp에서 이용 가능하여, 다양한 언어를 사용하는 사용자들이 널리 사용되는 통신 플랫폼에서 모델의 멀티모달 기능과 상호작용할 수 있습니다.