TinyLLaVA/TinyLLaVA_Factory

A Framework of Small-scale Large Multimodal Models

해결하는 문제

TinyLLaVA Factory는 소규모 대규모 다중모달 모델(LMM)을 구축하고 훈련하기 위한 모듈화된 코드베이스를 제공합니다. 다양한 구성 요소를 쉽게 조합할 수 있어 개발 노력과 오류를 줄이고, 훈련 결과의 재현성을 보장합니다.

작동 방식

이 프레임워크는 사용자가 다양한 컴포넌트를 조합하여 다중모달 모델을 구축할 수 있도록 합니다. 주요 구성 요소를 통합하고 있습니다:

  • LLMs: OpenELM, TinyLlama, StableLM, Qwen, Gemma, Phi 등 다양한 모델 지원.
  • 비전 타워: CLIP, SigLIP, Dino, CLIP과 Dino의 조합 지원.
  • 비전-언어 커넥터: MLP, Qformer, Resampler 지원.
  • 훈련 레시피: Frozen, Fully, Partially 튜닝 옵션과 함께 LoRA 및 QLoRA도 지원.

대상 사용자

새로 시작하지 않고도 소규모 다중모달 모델을 구축, 미세조정, 평가하고 싶은 연구자 및 개발자에게 적합합니다.

주요 특징

  • 모듈화 아키텍처: LLM, 비전 타워, 커넥터를 쉽게 교체 가능.
  • 고성능: TinyLLaVA-Phi-2-SigLIP-3.1B 모델은 LLaVA-1.5와 같은 기존 7B 모델보다 뛰어난 성능을 발휘.
  • 확장성: 새로운 LLM, 비전 타워, 커넥터를 추가하기 위한 명확한 가이드와 등록 패턴 제공.
  • 포괄적인 도구 세트: 사전 훈련, 미세조정, 평가용 스크립트, Gradio 웹 데모, CLI 추론 도구 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트