merveenoyan/smol-vision
Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜
何を解決するか
Smol Vision は、最先端の視覚およびマルチモーダルAIモデルを縮小・最適化・カスタマイズするためのレシピのコレクションを提供します。大規模な視覚言語モデル(VLM)や基礎モデルの効率を向上させ、より小さなハードウェアや特定のタスクに展開しやすくする課題に対処します。
仕組み
本プロジェクトは、さまざまな最適化およびファインチューニング技術を示すノートブックとスクリプトのシリーズから構成されています。
- 最適化: 🤗 Optimum、ONNX Runtime、Quanto などのツールを使用して、量子化やグラフ最適化を実行し、モデルサイズの削減とレイテンシの低減を実現します。
- ファインチューニング: PaliGemma、Florence-2、IDEFICS3、SmolVLM などのモデルに対して、QLoRA およびフルファインチューニングのレシピを提供し、VQAv2、DocVQA などの特定のデータセットで実行します。
- マルチモーダル RAG: ColPali と Qwen2-VL を使用して、重い処理を伴わずにドキュメントを検索するリトリーバー補強生成を実装します。
- Any-to-Any: Gemma-3n や OmniEmbed などのモデルを用いて、音声、テキスト、画像、動画などの複数モダリティ間でのファインチューニングと RAG を実証します。
対象ユーザー
パフォーマンス、サイズ、メモリ効率を最適化する必要がある、または専門的な視覚タスク向けにカスタマイズしたいAI開発者や研究者。
主な特徴
- 包括的な最適化: 量子化、知識蒸留、
torch.compileを用いた高速化をカバー。 - VLM のカスタマイズ: OCR やドキュメントQA向けの接地型ファインチューニング、専用VLMファインチューニングのレシピ。
- マルチモーダル RAG: マルチモーダルドキュメントの検索と生成のワークフロー。
- Any-to-Any 機能: 音声、テキスト、画像、動画モダリティ間でのファインチューニングと RAG をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト