Aya Vision: 以 8B 與 32B 模型推進多語言多模態

Cohere For AI 已發布 Aya Vision 系列,該系列由 8B 和 32B 參數的開放權重視覺語言模型(VLM)組成,旨在為 23 種不同語言帶來高效能的多模態功能。這些模型在多語言視覺語言任務中優於數個更大的競爭對手,為跨語言圖像理解與文字生成提供了堅實的基礎。

效能基準

Aya Vision 模型在兩個主要基準測試 AyaVisionBench 和 mWildVision 上,展現出比同等規模及顯著更大模型更優越的效能。

Aya Vision 32B

Aya Vision 32B 的表現優於其尺寸兩倍以上的模型。在成對比較中,它在 AyaVisionBench 上的勝率介於 50% 至 64%,在 mWildVision 上的勝率介於 52% 至 72%(平均於 23 種語言),對抗以下模型:

  • Llama-3.2 90B Vision
  • Molmo 72B
  • Qwen2.5-VL 72B

Aya Vision 8B

Aya Vision 8B 被定位為一種緊湊且高效的模型,領先於其參數類別。它優於 Qwen2.5-VL 7B、Pixtral 12B、Gemini Flash 1.5 8B、Llama-3.2 11B Vision、Molmo-D 7B 和 Pangea 7B 等模型,在 AyaVisionBench 上的勝率最高可達 79%,在 mWildBench 上的勝率最高可達 81%。

架構與訓練流程

Aya Vision 採用模組化架構,結合視覺編碼器、連接器和多語言文字解碼器,以處理任意解析度的圖像。

視覺處理與權杖壓縮

模型使用 SigLIP2-patch14-384 作為視覺編碼器。為處理高解析度圖像,系統會動態調整大小並將圖像分割成多個瓦片。為保持效率並降低延遲,採用 Pixel Shuffle 下採樣方法,在將圖像傳遞給 LLM 解碼器之前,將圖像權杖數量壓縮 4 倍。

文字解碼器初始化

  • Aya Vision 8B:初始化自 Cohere Command R7B,並使用 Aya Expanse 配方進行後續訓練,該配方包含多樣化的多語言數據、模型合併和偏好訓練。
  • Aya Vision 32B:初始化自 Aya Expanse 32B,以發揮其最先進的多語言表現。

二階段訓練流程

  1. 視覺-語言對齊:僅訓練視覺-語言連接器,而視覺編碼器和語言模型權重保持凍結。此步驟將圖像編碼器特徵映射到語言模型嵌入空間。
  2. 監督微調 (SFT):連接器和語言模型均在 23 種語言的多樣化多模態任務上進行訓練。

多語言數據增強

為克服代表性不足語言在真實世界多模態數據上的稀缺問題,Cohere For AI 實施了一個合成數據管道:

  1. 合成註解:使用高品質的英文數據集來生成合成註解。
  2. 翻譯與重新表述:數據被翻譯成 23 種語言,然後重新表述以移除翻譯產物並確保語言流暢。

此方法顯著提升了效能;對於 8B 模型,使用合成註解和擴展的多語言數據使其在 AyaVisionBench 上對抗 Pangea 7B 的勝率從 40.9% 提升至 58.1%(提升 17.2%)。

多模態模型合併

為確保模型在獲得視覺理解的同時保持高品質的對話與生成能力,Cohere For AI 將基礎語言模型與經微調的視覺-語言模型進行合併。此技術使 AyaVisionBench 上對抗 Pangea 7B 的多模態勝率提升 11.9%,達到總體勝率 70%。

此外,多模態模型合併使 Aya Vision 模型在僅文字任務上表現優異,相較於其他領先的 VLM,在 mArenaHard 數據集上的測量結果更佳。

AyaVisionBench: 新增多語言基準

Cohere For AI 已發布 AyaVisionBench,這是一個開放式的視覺-語言基準,涵蓋 23 種語言和 9 個任務類別,每種語言包含 135 個圖像-問題對。該基準評估以下能力:

  • 圖像說明與 OCR
  • 圖表與圖形理解
  • 文件理解與文字轉錄
  • 邏輯與數學推理
  • 將螢幕截圖轉換為程式碼
  • 識別兩張圖像之間的差異
  • 一般視覺問答

該數據集是使用 Cauldron 持出測試集的圖像建立的,以防止訓練洩漏。問題是透過合成生成,然後由人類標註者驗證,以確保它們真正依賴於視覺內容。

實際應用

Aya Vision 旨在提供全球可及性,目前已在 WhatsApp 上提供,使不同語言的使用者能夠在廣泛使用的通訊平台上與該模型的多模態功能進行互動。

Sources