Visual Salamandra 7B 发布
Visual Salamandra 是一个拥有 70 亿参数的多模态模型,扩展了 Salamandra 大语言模型(LLM),能够处理图像和视频。它旨在提供一种紧凑高效的视觉‑语言对齐解决方案,特别强调在多模态框架中对欧洲语言的表示。
技术架构与视觉语言对齐
Visual Salamandra 采用后融合(late‑fusion)架构来弥合视觉和文本模态之间的差距。系统基于 Salamandra Instructed 7B 模型,并集成了以下组件:
- 视觉编码器: Google 的 SigLIP-So400m 编码器,处理 384×384 分辨率的图像,划分为 14 个 patch。
- 投影层: 自定义训练的 2 层多层感知机(MLP),将编码器的图像嵌入映射到 LLM 的潜在空间。
- 主干模型: Salamandra Instructed 7B 基础模型。
四阶段训练流程
模型通过结构化的四阶段训练管线开发,以确保对齐的稳健性和泛化能力:
- 投影层预训练: 首阶段专注于训练 MLP 投影层,使图像特征与 LLM 的潜在空间对齐。
- 高质量视觉预训练: 编码器、投影层和 LLM 共同训练,使用精炼的数据集,包括重新标注的图像和 OCR 数据。
- 指令微调: 通过基于视觉的任务(如光学字符识别(OCR)和视觉问答(VQA))训练模型遵循用户指令。
- 全多模态微调: 最终阶段通过加入仅文本示例、单图像、多图像和视频数据,优化模型在真实场景中的泛化能力。
为支持该过程,实验室使用了 610 万条指令微调实例,其中包括 84.2 万条仅文本样本,数据来源包括 LLaVA Next、Cambrian 和 AI2D 等数据集,以提升数学推理、文档理解和视觉定位能力。
多语言支持与欧洲语言聚焦
Visual Salamandra 将语言多样性直接融入其多模态指令微调框架。通过聚焦欧洲语言,模型旨在弥合多模态 AI 研究中资源匮乏语言的差距,确保这些语言能够获得与主流语言同等水平的指令微调和视觉任务对齐。
能力与应用场景
Visual Salamandra 能够理解并生成上下文准确的响应,适用于多种输入。主要应用包括:
- 视觉问答(VQA): 对图像或视频相关的问题提供上下文感知的答案。
- 光学字符识别(OCR): 从图表、场景和文档中转录文本。
- 文档与图表理解: 分析包含嵌入文本的图形内容和复杂视觉文档。
- 数学推理: 解决基于视觉的数学问题。
- 基于指令的图像交互: 根据详细指令执行定位任务和图像描述。
- 视频分析: 模型架构支持未来在事件检测、多模态叙事和视频摘要等方面的发展。
局限性与伦理考量
尽管具备强大能力,Visual Salamandra 仍存在已知局限:
- 幻觉: 当视觉输入模糊时,模型可能生成看似合理但不正确的答案。
- OCR 复杂度: 在处理密集文档布局或高度复杂的 OCR 任务时仍具挑战。
- 偏见: 虽然使用了过滤和授权的数据集进行训练,模型仍可能表现出偏见或不准确。
Visual Salamandra 在 Apache License, Version 2.0 下发布,仅供研究和非商业用途。