merveenoyan/smol-vision
Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜
解決的問題
Smol Vision 提供一系列用於縮小、優化和客製化前沿視覺與多模態 AI 模型的食譜。它解決了大型視覺語言模型(VLM)與基礎模型在小型硬體或特定任務上部署時效率低下的挑戰。
如何運作
本專案由一系列筆記本與指令碼組成,展示各種優化與微調技術:
- 優化: 使用 🤗 Optimum、ONNX Runtime 和 Quanto 等工具進行量化與圖形優化,以減少模型大小並降低延遲。
- 微調: 提供 PaliGemma、Florence-2、IDEFICS3 和 SmolVLM 等模型在特定資料集(例如 VQAv2、DocVQA)上的 QLoRA 與完整微調食譜。
- 多模態 RAG: 使用 ColPali 和 Qwen2-VL 實現檢索增強生成,無需繁重處理即可檢索文件。
- 任意模態到任意模態(Any-to-Any): 使用 Gemma-3n 和 OmniEmbed 等模型,示範跨音訊、文字、影像與影片等多種模態的微調與 RAG。
適用對象
希望優化視覺與多模態模型在效能、大小與記憶體效率方面的表現,或將其客製化以應用於特定視覺任務的 AI 開發者與研究人員。
主要亮點
- 全面優化: 涵蓋量化、知識蒸餾與
torch.compile以實現加速。 - VLM 客製化: 提供基於事實的微調與針對 OCR 及文件問答的專用 VLM 微調食譜。
- 多模態 RAG: 提供多模態文件檢索與生成的工作流程。
- 任意模態到任意模態能力: 支援跨音訊、文字、影像與影片模態的微調與 RAG。
相關
- 專案
- 專案
- 專案
- 專案
- 專案