mbzuai-oryx/LLaVA-pp

🔥🔥 LLaVA++: Extending LLaVA with Phi-3 and LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)

What it solves

LLaVA++ 通过将 LLaVA 1.5 模型与更现代且强大的大语言模型 (LLMs) 如 LLaMA-3 和 Phi-3 整合,扩展了其视觉能力。这使得在指令遵循和学术任务导向的视觉任务上,能有更好的表现。

How it works

该项目提供了一个框架,用于将 LLaVA 的视觉架构与 Phi-3 Mini Instruct (3.8B) 和 LLaMA-3 Instruct (8B) 整合。它支持多种训练阶段,包括在 LCS-558K 数据集上进行预训练,以及使用 LoRA 或全参数微调(包括 S2 微调)在 LLaVA-Instruct-665K 数据集上进行微调。

Who it is for

想要使用或训练基于最新 LLM 骨干网络的多模态 AI 领域的开发者和研究人员。

Highlights

  • 集成了 LLaMA-3 Instruct 8B 和 Phi-3 Mini Instruct 3.8B。
  • 支持 LoRA、全参数微调和 S2 微调方法。
  • 在 Model-Zoo 中提供预训练和微调后的模型权重。
  • 提供用于预训练和微调模型的脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目