mbzuai-oryx/LLaVA-pp
🔥🔥 LLaVA++: Extending LLaVA with Phi-3 and LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
What it solves
LLaVA++ 透過將 LLaVA 1.5 模型與更現代且強大的大型語言模型 (LLMs) 如 LLaMA-3 與 Phi-3 整合,擴展了其視覺能力。這使得在指令遵循與學術任務導向的視覺任務上,能有更佳的表現。
How it works
本專案提供了一個框架,用於將 LLaVA 的視覺架構與 Phi-3 Mini Instruct (3.8B) 及 LLaMA-3 Instruct (8B) 整合。它支援多個訓練階段,包括在 LCS-558K 資料集上進行預訓練,以及使用 LoRA 或全參數微調(包含 S2 微調)在 LLaVA-Instruct-665K 資料集上進行微調。
Who it’s for
想要使用或訓練基於最新 LLM 骨幹網路的多模態 AI 領域的開發者與研究人員。
Highlights
- 整合了 LLaMA-3 Instruct 8B 與 Phi-3 Mini Instruct 3.8B。
- 支援 LoRA、全參數微調以及 S2 微調方法。
- 在 Model-Zoo 中提供預訓練與微調後的模型權重。
- 提供用於預訓練與微調模型的腳本。
相關
- 專案
- 專案
- 專案
- 專案