merveenoyan/smol-vision

Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜

何を解決するか

Smol Vision は、最先端の視覚およびマルチモーダルAIモデルを縮小・最適化・カスタマイズするためのレシピのコレクションを提供します。大規模な視覚言語モデル(VLM)や基礎モデルの効率を向上させ、より小さなハードウェアや特定のタスクに展開しやすくする課題に対処します。

仕組み

本プロジェクトは、さまざまな最適化およびファインチューニング技術を示すノートブックとスクリプトのシリーズから構成されています。

  • 最適化: 🤗 Optimum、ONNX Runtime、Quanto などのツールを使用して、量子化やグラフ最適化を実行し、モデルサイズの削減とレイテンシの低減を実現します。
  • ファインチューニング: PaliGemma、Florence-2、IDEFICS3、SmolVLM などのモデルに対して、QLoRA およびフルファインチューニングのレシピを提供し、VQAv2、DocVQA などの特定のデータセットで実行します。
  • マルチモーダル RAG: ColPali と Qwen2-VL を使用して、重い処理を伴わずにドキュメントを検索するリトリーバー補強生成を実装します。
  • Any-to-Any: Gemma-3n や OmniEmbed などのモデルを用いて、音声、テキスト、画像、動画などの複数モダリティ間でのファインチューニングと RAG を実証します。

対象ユーザー

パフォーマンス、サイズ、メモリ効率を最適化する必要がある、または専門的な視覚タスク向けにカスタマイズしたいAI開発者や研究者。

主な特徴

  • 包括的な最適化: 量子化、知識蒸留、torch.compile を用いた高速化をカバー。
  • VLM のカスタマイズ: OCR やドキュメントQA向けの接地型ファインチューニング、専用VLMファインチューニングのレシピ。
  • マルチモーダル RAG: マルチモーダルドキュメントの検索と生成のワークフロー。
  • Any-to-Any 機能: 音声、テキスト、画像、動画モダリティ間でのファインチューニングと RAG をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト