mbzuai-oryx/LLaVA-pp
🔥🔥 LLaVA++: Extending LLaVA with Phi-3 and LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
What it solves
LLaVA++ 通过将 LLaVA 1.5 模型与更现代且强大的大语言模型 (LLMs) 如 LLaMA-3 和 Phi-3 整合,扩展了其视觉能力。这使得在指令遵循和学术任务导向的视觉任务上,能有更好的表现。
How it works
该项目提供了一个框架,用于将 LLaVA 的视觉架构与 Phi-3 Mini Instruct (3.8B) 和 LLaMA-3 Instruct (8B) 整合。它支持多种训练阶段,包括在 LCS-558K 数据集上进行预训练,以及使用 LoRA 或全参数微调(包括 S2 微调)在 LLaVA-Instruct-665K 数据集上进行微调。
Who it is for
想要使用或训练基于最新 LLM 骨干网络的多模态 AI 领域的开发者和研究人员。
Highlights
- 集成了 LLaMA-3 Instruct 8B 和 Phi-3 Mini Instruct 3.8B。
- 支持 LoRA、全参数微调和 S2 微调方法。
- 在 Model-Zoo 中提供预训练和微调后的模型权重。
- 提供用于预训练和微调模型的脚本。
相关
- 项目
- 项目
- 项目
- 项目