merveenoyan/smol-vision
Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜
해결하는 문제
Smol Vision은 최신 시각 및 멀티모달 AI 모델을 축소하고 최적화하며 맞춤화하기 위한 레시피 모음입니다. 대규모 시각-언어 모델(VLM)과 기초 모델의 효율성을 높여, 더 작은 하드웨어나 특정 작업에 배포하기 쉽게 만듭니다.
작동 방식
다양한 최적화 및 피팅 기법을 보여주는 노트북과 스크립트로 구성된 프로젝트입니다.
- 최적화: 🤗 Optimum, ONNX Runtime, Quanto 등의 도구를 사용해 양자화 및 그래프 최적화를 수행하여 모델 크기 감소와 지연 시간 감소를 달성합니다.
- 피팅: PaliGemma, Florence-2, IDEFICS3, SmolVLM 등의 모델에 대해 QLoRA 및 전체 피팅 레시피를 제공하며, VQAv2, DocVQA와 같은 특정 데이터셋에서 실행합니다.
- 멀티모달 RAG: ColPali와 Qwen2-VL을 사용해 무거운 처리 없이 문서를 검색하는 검색 기반 생성을 구현합니다.
- Any-to-Any: Gemma-3n 및 OmniEmbed 등의 모델을 활용해 음성, 텍스트, 이미지, 동영상 등 다양한 모달리티 간의 피팅 및 RAG를 시연합니다.
대상 사용자
성능, 크기, 메모리 효율성을 최적화하거나 전문적인 시각 작업에 맞게 모델을 맞춤화하고자 하는 AI 개발자 및 연구자.
주요 특징
- 포괄적인 최적화: 양자화, 지식 증류,
torch.compile을 통한 성능 향상 포함. - VLM 맞춤화: OCR 및 문서 QA를 위한 기반 피팅 및 특화된 VLM 피팅 레시피.
- 멀티모달 RAG: 멀티모달 문서 검색 및 생성을 위한 워크플로우 제공.
- Any-to-Any 기능: 음성, 텍스트, 이미지, 동영상 모달리티 간의 피팅 및 RAG 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트