mbzuai-oryx/LLaVA-pp

🔥🔥 LLaVA++: Extending LLaVA with Phi-3 and LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)

What it solves

LLaVA++는 LLaVA 1.5 모델의 시각적 능력을 LLaMA-3 및 Phi-3와 같은 더 현대적이고 강력한 대규모 언어 모델 (LLMs)를 통합함으로써 확장합니다. 이를 통해 지시 수행 및 학술적 작업 중심의 시각적 작업에서 향상된 성능을 제공합니다.

How it works

이 프로젝트는 LLaVA의 시각적 아키텍처를 Phi-3 Mini Instruct (3.8B) 및 LLaMA-3 Instruct (8B)와 통합하는 프레임워크를 제공합니다. LCS-558K 데이터셋을 이용한 사전 학습과 LLaVA-Instruct-665K 데이터셋을 이용한 LoRA 또는 전체 파인튜닝 (S2 파인튜닝 포함)을 사용하는 다단계 학습 과정을 지원합니다.

Who it’s for

최신 LLM 백본을 기반으로 멀티모달 모델을 사용하거나 학습시키고자 하는 멀티모달 AI 분야의 개발자 및 연구자.

Highlights

  • LLaMA-3 Instruct 8B 및 Phi-3 Mini Instruct 3.8B 통합.
  • LoRA, 전체 파인튜닝 및 S2 파인튜닝 방식 지원.
  • Model-Zoo에서 사전 학습 및 파인튜닝된 모델 가중치를 제공.
  • 모델의 사전 학습 및 파인튜닝을 위한 스크립트를 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트