jingyaogong/minimind-v

👀 Train a 65M-parameter VLM from scratch in just 2h!

解决的问题

MiniMind-V 提供了一种轻量级且易于使用的构建和训练视觉语言模型 (VLM) 的方法。它通过提供一个极简的实现,使得在单张消费级 GPU(如 NVIDIA 3090)上可以在极短的时间内以极低的成本完成训练,从而解决了 VLM 开发门槛高的问题。

工作原理

MiniMind-V 通过添加视觉编码器 (Visual Encoder) 和投影模块 (Projection Module) 来扩展小型语言模型 (MiniMind)。

  • Visual Encoder: 使用 SigLIP2 模型提取图像特征,将图像转换为一组视觉 token。
  • Projection Module: MLP (多层感知器) 投影器将这些视觉特征转换到语言模型的语义空间,有效地充当将图像翻译成 LLM 可理解语言的“字典”。
  • Training: 训练过程包括两个阶段:可选的预训练 (Pretrain) 阶段,用于将视觉 token 与语言 token 对齐(仅训练投影器);以及强制性的 SFT (有监督微调) 阶段,用于优化模型的指令遵循和图像描述能力(训练投影器以及 LLM 的首尾层)。

适用对象

  • AI 学习者: 希望学习 VLM 结构和训练过程的清晰、无术语教程的人。
  • 个人开发者: 拥有有限硬件,希望在个人 GPU 上尝试多模态模型的人。
  • 研究人员: 正在寻找 VLM 范式极简基准实现的研究人员。

亮点

  • 极度轻量化: 最小版本仅有 65M 参数,比 GPT-3 小得多。
  • 低成本: 在单张 RTX 3090 上训练 2 小时仅需约 3 元人民币(约 0.40 美元)。
  • 完整的流水线: 包含数据集清洗、预训练和 SFT 的完整代码。
  • 灵活的架构: 支持 Dense 和混合专家模型 (MoE) 模式。
  • 高效的数据处理: 使用 Parquet 格式进行图文集成存储,以加快加载速度。

相关

  • 项目
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目