merveenoyan/smol-vision

Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜

해결하는 문제

Smol Vision은 최신 시각 및 멀티모달 AI 모델을 축소하고 최적화하며 맞춤화하기 위한 레시피 모음입니다. 대규모 시각-언어 모델(VLM)과 기초 모델의 효율성을 높여, 더 작은 하드웨어나 특정 작업에 배포하기 쉽게 만듭니다.

작동 방식

다양한 최적화 및 피팅 기법을 보여주는 노트북과 스크립트로 구성된 프로젝트입니다.

  • 최적화: 🤗 Optimum, ONNX Runtime, Quanto 등의 도구를 사용해 양자화 및 그래프 최적화를 수행하여 모델 크기 감소와 지연 시간 감소를 달성합니다.
  • 피팅: PaliGemma, Florence-2, IDEFICS3, SmolVLM 등의 모델에 대해 QLoRA 및 전체 피팅 레시피를 제공하며, VQAv2, DocVQA와 같은 특정 데이터셋에서 실행합니다.
  • 멀티모달 RAG: ColPali와 Qwen2-VL을 사용해 무거운 처리 없이 문서를 검색하는 검색 기반 생성을 구현합니다.
  • Any-to-Any: Gemma-3n 및 OmniEmbed 등의 모델을 활용해 음성, 텍스트, 이미지, 동영상 등 다양한 모달리티 간의 피팅 및 RAG를 시연합니다.

대상 사용자

성능, 크기, 메모리 효율성을 최적화하거나 전문적인 시각 작업에 맞게 모델을 맞춤화하고자 하는 AI 개발자 및 연구자.

주요 특징

  • 포괄적인 최적화: 양자화, 지식 증류, torch.compile을 통한 성능 향상 포함.
  • VLM 맞춤화: OCR 및 문서 QA를 위한 기반 피팅 및 특화된 VLM 피팅 레시피.
  • 멀티모달 RAG: 멀티모달 문서 검색 및 생성을 위한 워크플로우 제공.
  • Any-to-Any 기능: 음성, 텍스트, 이미지, 동영상 모달리티 간의 피팅 및 RAG 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트