TinyLLaVA/TinyLLaVA_Factory

A Framework of Small-scale Large Multimodal Models

解決的問題

TinyLLaVA Factory 提供模組化程式碼庫,用於建構與訓練小規模大型多模態模型(LMM)。透過減少程式碼撰寫工作量與錯誤,簡化多模態模型的客製化流程,同時確保訓練結果可重現。

工作原理

此框架允許使用者混合搭配不同元件來建構多模態模型。整合了多個關鍵建構模組:

  • LLMs:支援 OpenELM、TinyLlama、StableLM、Qwen、Gemma 與 Phi 等模型。
  • 視覺塔:支援 CLIP、SigLIP、Dino,以及 CLIP 與 Dino 的組合。
  • 視覺-語言連接器:支援 MLP、Qformer 與 Resampler。
  • 訓練配方:支援 Frozen、Fully 與 Partially 調整,以及 LoRA 與 QLoRA。

適用對象

專為希望建構、微調或評估小規模多模態模型,但無需從零開始的研究人員與開發者設計。

主要亮點

  • 模組化架構:可輕鬆更換 LLM、視覺塔與連接器。
  • 高效率:TinyLLaVA-Phi-2-SigLIP-3.1B 模型性能超越部分現有的 7B 模型(如 LLaVA-1.5)。
  • 可擴充性:提供清晰的指南與註冊模式,方便新增 LLM、視覺塔與連接器。
  • 完整的工具鏈:包含預訓練、微調與評估腳本,以及 Gradio Web 示範與 CLI 推理工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案