Chinese CLIP:中文對比視覺語言預訓練

Qwen 推出了 Chinese CLIP,一個對比式視覺語言預訓練模型,旨在專門彌合視覺與中文語言之間的鴻溝。該模型針對依賴機器翻譯或多語言 CLIP 變體的現有多模態模型的限制,這些模型往往在處理中文特有的文化概念與本土資料分佈時遇到困難。

為何需要語言特定的 CLIP

標準的 CLIP 模型及其多語言對應版本常常無法捕捉中文文化與社會景觀的細微差異。Qwen 在現有方法中指出兩個主要的失敗點:

  • Translation Degradation(翻譯退化): 使用原始 CLIP 結合機器翻譯處理中文文本,與以中文為母語的預訓練相比,性能會顯著下降。
  • Cultural Bias(文化偏見): 像 mCLIP 這樣的多語言模型往往難以理解中文特有的概念,常常檢索到與西方文化相關的項目,而非本土中文情境。

兩階段預訓練方法論

為了有效將 CLIP 的能力轉移至中文,Qwen 採用了兩階段預訓練方法,而非從頭訓練,研究人員將此描述為更具成本效益的做法。

階段 1:語言編碼器微調

在第一階段,模型初始化兩個塔:來自原始 CLIP 的視覺編碼器(例如 ViT-B 或 ResNet)以及作為語言編碼器的中文 RoBERTa(RoBERTA-wwm-Chinese)。視覺編碼器保持凍結,語言編碼器則以對比方式微調,使其表示映射到 CLIP 視覺編碼器的輸出空間。

階段 2:聯合微調

在第二階段,視覺編碼器解凍。視覺與語言編碼器一起以對比方式微調。這使得視覺編碼器能適應中文資料中的圖像分佈,捕捉區域文化價值與視覺特徵。

訓練資料與模型變體

該模型在約 2 億對圖像-文字配對上進行預訓練。為確保可重現性,團隊主要使用公開資料集,包括:

  • LAION-5B 的中文("zh")部分
  • Wukong 資料集
  • 從 MSCOCO 與 Visual Genome 翻譯而來的資料

Qwen 發布了五種模型變體,以滿足不同的效能與效率需求:

  • ResNet-50
  • ViT-B/16
  • ViT-L/14
  • ViT-L/14 @336px
  • ViT-H/14

效能與基準測試

Chinese CLIP 在多項檢索與分類任務上展現出卓越效能,尤其在本土中文資料集上表現突出。

跨模態檢索

實驗在三個資料集上進行:MUGE(中文本土資料集)、Flickr30K-CN 與 COCO-CN(英語本土資料集)。Chinese CLIP 在全部三個資料集上均超越先前最佳模型,其中在 MUGE 資料集上表現差距最大,顯示其對本土中文資料的強大處理能力。

零樣本圖像分類

使用手動翻譯標籤與提示的 ELEVATER 基準測試,Chinese CLIP 獲得了具競爭力的表現,證明其即使在英語本土基準上亦具有效性。

消融實驗結果

消融研究證實,兩階段預訓練方法較從頭訓練顯著更有效,且第二階段的微調進一步提升了跨模態檢索的效能。

未來方向

雖然 Chinese CLIP 在檢索與分類方面已展現效能,研究人員仍希望進一步驗證其作為視覺基礎模型的角色。未來的工作將聚焦於建立專屬於中文多模態與視覺表徵學習的基準測試。

Sources