中文 CLIP:中文对比视觉语言预训练

Qwen 推出了中文 CLIP,这是一种对比视觉语言预训练模型,旨在专门弥合视觉与语言在中文之间的鸿沟。该模型解决了现有多模态模型依赖机器翻译或多语言 CLIP 变体的局限性,这些模型往往在处理中文特有的文化概念和本土数据分布时表现不佳。

为什么需要语言特定的 CLIP

标准的 CLIP 模型及其多语言版本常常无法捕捉中文文化和社会景观的细微差别。Qwen 发现现有方法存在两个主要的失败点:

  • 翻译退化: 将原始 CLIP 与机器翻译结合用于中文文本,相较于原生中文预训练会显著降低性能。
  • 文化偏见: 像 mCLIP 这样的多语言模型常常难以理解中文特有的概念,往往检索到与西方文化相关的内容,而非本土中文语境。

两阶段预训练方法论

为了高效地将 CLIP 的能力迁移到中文,Qwen 采用了两阶段预训练方法,而非从头训练,研究人员将其描述为一种更具成本效益的方案。

阶段 1:语言编码器调优

在第一阶段,模型初始化两个塔:来自原始 CLIP 的视觉编码器(例如 ViT-B 或 ResNet)和中文 RoBERTa(RoBERTA-wwm-Chinese)作为语言编码器。视觉编码器保持冻结,语言编码器通过对比方式进行调优,使其表示映射到 CLIP 视觉编码器的输出空间。

阶段 2:联合微调

在第二阶段,视觉编码器被解锁。视觉编码器和语言编码器一起进行对比调优。这使得视觉编码器能够适应中文数据中的图像分布,捕捉区域文化价值和视觉特征。

训练数据与模型变体

该模型在约 2 亿图文对上进行预训练。为确保可复现性,团队主要使用了公开数据集,包括:

  • LAION-5B 的中文(“zh”)部分
  • Wukong 数据集
  • 来自 MSCOCO 和 Visual Genome 的翻译数据

Qwen 发布了五种模型变体,以满足不同的性能和效率需求:

  • ResNet-50
  • ViT-B/16
  • ViT-L/14
  • ViT-L/14 @336px
  • ViT-H/14

性能与基准测试

中文 CLIP 在多个检索和分类任务上表现出卓越的性能,尤其是在本土中文数据集上。

跨模态检索

实验在三个数据集上进行:MUGE(中文本土数据集)、Flickr30K-CN 和 COCO-CN(英文本土数据集)。中文 CLIP 在全部三个数据集上均超越了之前的最佳模型,其中在 MUGE 数据集上表现差距最大,表明其在处理本土中文数据方面具备强大能力。

零样本图像分类

使用带有人工翻译标签和提示的 ELEVATER 基准,中文 CLIP 达到了竞争性的表现,展示了其即使在英文本土基准上也具备有效性。

消融实验结果

消融研究证实,两阶段预训练方法显著优于从头训练,且第二阶段的调优进一步提升了跨模态检索性能。

未来方向

虽然中文 CLIP 在检索和分类方面表现有效,研究人员仍希望进一步验证其作为视觉基础模型的作用。未来工作将侧重于构建专门针对中文多模态和视觉表征学习的基准。

Sources