TinyLLaVA/TinyLLaVA_Factory
A Framework of Small-scale Large Multimodal Models
解決的問題
TinyLLaVA Factory 提供模組化程式碼庫,用於建構與訓練小規模大型多模態模型(LMM)。透過減少程式碼撰寫工作量與錯誤,簡化多模態模型的客製化流程,同時確保訓練結果可重現。
工作原理
此框架允許使用者混合搭配不同元件來建構多模態模型。整合了多個關鍵建構模組:
- LLMs:支援 OpenELM、TinyLlama、StableLM、Qwen、Gemma 與 Phi 等模型。
- 視覺塔:支援 CLIP、SigLIP、Dino,以及 CLIP 與 Dino 的組合。
- 視覺-語言連接器:支援 MLP、Qformer 與 Resampler。
- 訓練配方:支援 Frozen、Fully 與 Partially 調整,以及 LoRA 與 QLoRA。
適用對象
專為希望建構、微調或評估小規模多模態模型,但無需從零開始的研究人員與開發者設計。
主要亮點
- 模組化架構:可輕鬆更換 LLM、視覺塔與連接器。
- 高效率:TinyLLaVA-Phi-2-SigLIP-3.1B 模型性能超越部分現有的 7B 模型(如 LLaVA-1.5)。
- 可擴充性:提供清晰的指南與註冊模式,方便新增 LLM、視覺塔與連接器。
- 完整的工具鏈:包含預訓練、微調與評估腳本,以及 Gradio Web 示範與 CLI 推理工具。
相關
- 專案
- 專案
- 專案
- 專案
- 專案