jingyaogong/minimind-v
👀 Train a 65M-parameter VLM from scratch in just 2h!
해결하는 문제
MiniMind-V는 Vision Language Model (VLM)을 구축하고 학습할 수 있는 가볍고 접근하기 쉬운 방법을 제공합니다. 단일 소비자용 GPU(NVIDIA 3090 등)에서 매우 짧은 시간 내에 매우 낮은 비용으로 학습할 수 있는 최소한의 구현을 제공함으로써 VLM 개발의 높은 진입 장벽을 해결합니다.
작동 원리
MiniMind-V는 Visual Encoder와 프로젝션 모듈을 추가하여 소형 언어 모델(MiniMind)을 확장합니다.
- Visual Encoder: SigLIP2 모델을 사용하여 이미지 특징을 추출하고 이미지를 시각적 토큰 세트로 변환합니다.
- Projection Module: MLP (Multi-Layer Perceptron) 프로젝터가 이러한 시각적 특징을 언어 모델의 의미 공간으로 변환하며, 이미지를 LLM이 이해할 수 있는 언어로 번역하는 "사전" 역할을 합니다.
- Training: 프로세스는 두 단계로 구성됩니다. 시각적 토큰을 언어 토큰과 정렬하기 위한 선택적 Pretrain 단계(프로젝터만 학습)와 모델의 지시 이행 및 이미지 설명 능력을 정교화하기 위한 필수 SFT (Supervised Fine-Tuning) 단계(프로젝터와 LLM의 처음/마지막 레이어 학습)입니다.
대상자
- AI 학습자: VLM의 구조와 학습 방법에 대해 전문 용어가 적고 명확한 튜토리얼을 원하는 분.
- 개인 개발자: 제한된 하드웨어 환경에서 개인 GPU로 멀티모달 모델을 실험하고자 하는 분.
- 연구자: VLM 패러다임의 최소한의 베이스라인 구현을 찾는 분.
주요 특징
- 극도로 가벼움: 가장 작은 버전은 파라미터가 65M에 불과하여 GPT-3보다 훨씬 작습니다.
- 저비용: 단일 RTX 3090에서 2시간 동안 약 3 RMB(약 0.40달러)로 학습이 가능합니다.
- 포괄적인 파이프라인: 데이터셋 정제, 사전 학습 및 SFT를 위한 전체 코드를 포함합니다.
- 유연한 아키텍처: Dense 및 Mixture-of-Experts (MoE) 모드를 모두 지원합니다.
- 효율적인 데이터 처리: Parquet 형식을 사용하여 이미지-텍스트 통합 저장을 구현함으로써 로딩 속도를 높였습니다.
관련
- 프로젝트
- Dispatch
- Dispatch
- Dispatch
- 프로젝트