TinyLLaVA/TinyLLaVA_Factory

A Framework of Small-scale Large Multimodal Models

解决的问题

TinyLLaVA Factory 提供了一个模块化的代码库,用于构建和训练小规模大型多模态模型(LMM)。它通过减少编码工作量和错误,简化了多模态模型的定制过程,同时确保训练结果可复现。

工作原理

该框架允许用户混合搭配不同组件来构建多模态模型。它集成了多个关键构建模块:

  • LLMs:支持 OpenELM、TinyLlama、StableLM、Qwen、Gemma 和 Phi 等模型。
  • 视觉塔:支持 CLIP、SigLIP、Dino,以及 CLIP 与 Dino 的组合。
  • 视觉-语言连接器:支持 MLP、Qformer 和 Resampler。
  • 训练配方:支持 Frozen、Fully 和 Partially 调整,以及 LoRA 和 QLoRA。

适用人群

专为希望构建、微调或评估小规模多模态模型但无需从零开始的研究人员和开发者设计。

主要亮点

  • 模块化架构:可轻松更换 LLM、视觉塔和连接器。
  • 高性能:TinyLLaVA-Phi-2-SigLIP-3.1B 模型性能优于某些现有的 7B 模型(如 LLaVA-1.5)。
  • 可扩展性:提供清晰的指南和注册模式,便于添加新的 LLM、视觉塔和连接器。
  • 全面的工具链:包含预训练、微调和评估脚本,以及 Gradio Web 演示和 CLI 推理工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目