IDEFICS: 最先进的视觉语言模型的开放复现

Hugging Face 发布了 IDEFICS(Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attentionS),这是一个开放访问的视觉语言模型。IDEFICS 是 DeepMind Flamingo 的开放复现,旨在为 AI 社区提供一个透明的、开放访问的专有多模态模型的替代方案。

模型能力和变体

IDEFICS 是一个多模态模型,能够接受任意交错的图像和文本序列作为输入并生成连贯的文本作为输出。这使得模型能够执行诸如回答关于图像的问题、描述视觉内容以及基于多张图像创建故事等任务。

该模型提供两种主要规模和两种功能变体:

  • 参数规模:90亿和800亿参数。
  • 模型变体:一个基础版本和一个指令版本(例如 idefics-80B-instructidefics-9B-instruct),专门用于对话场景。

技术架构和基础

IDEFICS 使用公开可用的模型和数据构建。它利用以下组件:

  • 语言模型:LLaMA v1。
  • 视觉编码器:OpenCLIP。

这两个预训练模型通过 Hugging Face 训练的新初始化参数相连接。虽然基础模型被冻结,但这些连接参数是在 MIT 许可证下发布的。

训练数据和 OBELICS 数据集

IDEFICS 在多个开放数据集的混合上进行训练,包括 Wikipedia、Public Multimodal Dataset 和 LAION。为了增强其能力,Hugging Face 创建并发布了 OBELICS,这是一个由从网络抓取的 1.41 亿条交错图像-文本文档组成的新数据集,包含总共 3.53 亿张图像和 1150 亿个标记。

伦理评估和透明度

为了确保透明度和安全性,Hugging Face 遵循了一份以自我批判、透明和公平为重点的伦理章程。发布过程包括:

  • 红队测试:使用带有图像和文本的对抗性提示进行内部评估,以识别和缓解潜在偏见。
  • 文档:发布在构建过程中遇到的技术经验和错误,以向社区提供学习资源。
  • 工具:通过 Nomic AI 提供 OBELICS 数据集的交互式可视化。

许可证和访问

IDEFICS 的访问受其基础组件许可证的限制:

  • CLIP-ViT-H-14-laion2B-s32B-b79K:根据 MIT 许可证发布。
  • llama-65b:根据非商业研究许可证发布(需要提交 Meta 申请表)。
  • 附加权重:新训练的连接参数根据 MIT 许可证发布。

IDEFICS 已集成到 transformers 库中,用户可以通过 IdeficsForVisionText2TextAutoProcessor 加载模型。

Sources