Aya Vision: 使用 8B 和 32B 模型推进多语言多模态
Cohere For AI 发布了 Aya Vision 系列,该系列由 8B 和 32B 参数的开放权重视觉语言模型(VLM)组成,旨在为 23 种不同语言提供高性能多模态功能。这些模型在多语言视觉语言任务中优于几个更大的竞争对手,为跨多种语言的图像理解和文本生成提供了坚实的基础。
性能基准
Aya Vision 模型在两个主要基准测试 AyaVisionBench 和 mWildVision 上,表现出优于同样大小和显著更大模型的性能。
Aya Vision 32B
Aya Vision 32B 的性能优于其大小超过两倍的模型。在成对比较中,它在 AyaVisionBench 上的胜率在 50% 到 64% 之间,在 mWildVision 上的胜率在 52% 到 72% 之间(平均跨 23 种语言),对比以下模型:
- Llama-3.2 90B Vision
- Molmo 72B
- Qwen2.5-VL 72B
Aya Vision 8B
Aya Vision 8B 被定位为一种紧凑高效的模型,领先于其参数类别。它优于 Qwen2.5-VL 7B、Pixtral 12B、Gemini Flash 1.5 8B、Llama-3.2 11B Vision、Molmo-D 7B 和 Pangea 7B 等模型,在 AyaVisionBench 上的胜率最高可达 79%,在 mWildBench 上的胜率最高可达 81%。
架构与训练流程
Aya Vision 采用模块化架构,将视觉编码器、连接器和多语言文本解码器结合起来,以处理任意分辨率的图像。
视觉处理与令牌压缩
模型使用 SigLIP2-patch14-384 作为视觉编码器。为了处理高分辨率图像,系统会动态调整大小并将图像分割成多个瓦片。为了保持效率并降低延迟,采用 Pixel Shuffle 下采样方法,在将图像令牌传递给 LLM 解码器之前,将图像令牌的数量压缩 4 倍。
文本解码器初始化
- Aya Vision 8B:初始化自 Cohere Command R7B,并使用 Aya Expanse 配方进行后训练,该配方包括多样化的多语言数据、模型合并和偏好训练。
- Aya Vision 32B:初始化自 Aya Expanse 32B,以利用其最先进的多语言性能。
两阶段训练过程
- 视觉语言对齐:仅训练视觉语言连接器,而视觉编码器和语言模型权重保持冻结。这将图像编码器特征映射到语言模型嵌入空间。
- 监督微调(SFT):连接器和语言模型在 23 种语言的多样化多模态任务上进行训练。
多语言数据增强
为了克服代表性不足语言中真实世界多模态数据的稀缺性,Cohere For AI 实施了合成数据管道:
- 合成注释:使用高质量的英文数据集生成合成注释。
- 翻译和重新表述:数据被翻译成 23 种语言,然后重新表述以消除翻译伪迹并确保语言流畅性。
此方法显著提升了性能;对于 8B 模型,使用合成注释和扩展的多语言数据使其在 AyaVisionBench 上对 Pangea 7B 的胜率从 40.9% 提升至 58.1%(提升 17.2%)。
多模态模型合并
为了确保模型在获得视觉理解的同时保持高质量的对话和生成能力,Cohere For AI 将基础语言模型与微调后的视觉语言模型合并。此技术使 AyaVisionBench 上对 Pangea 7B 的多模态胜率提高了 11.9%,达到总胜率 70%。
此外,多模态模型合并使 Aya Vision 模型在 mArenaHard 数据集上的纯文本任务中表现优异,优于其他领先的 VLM。
AyaVisionBench:一个新的多语言基准
Cohere For AI 发布了 AyaVisionBench,这是一个开放式的视觉语言基准,覆盖 23 种语言和 9 个任务类别,每种语言包含 135 个图像-问题对。该基准评估以下能力:
- 图像描述和 OCR
- 图表和图形理解
- 文档理解和文本转录
- 逻辑和数学推理
- 将截图转换为代码
- 识别两张图像之间的差异
- 通用视觉问答
数据集是使用 Cauldron 持外测试集中的图像创建的,以防止训练泄露。问题通过合成生成,然后由人工注释员验证,以确保它们真正依赖于视觉上下文。
实际应用
Aya Vision 旨在实现全球可访问性,目前已在 WhatsApp 上提供,使用户能够在广泛使用的通信平台上以不同语言与该模型的多模态功能进行交互。