merveenoyan/smol-vision
Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜
解决的问题
Smol Vision 提供了一系列用于缩小、优化和定制前沿视觉与多模态 AI 模型的配方。它解决了大型视觉语言模型(VLM)和基础模型在小型硬件或特定任务上部署时效率低下的挑战。
如何工作
该项目由一系列笔记本和脚本组成,展示了各种优化和微调技术:
- 优化: 使用 🤗 Optimum、ONNX Runtime 和 Quanto 等工具进行量化和图优化,以减小模型大小并降低延迟。
- 微调: 提供 PaliGemma、Florence-2、IDEFICS3 和 SmolVLM 等模型在特定数据集(如 VQAv2、DocVQA)上的 QLoRA 和全量微调配方。
- 多模态 RAG: 使用 ColPali 和 Qwen2-VL 实现检索增强生成,无需复杂处理即可检索文档。
- 任意模态到任意模态(Any-to-Any): 使用 Gemma-3n 和 OmniEmbed 等模型,演示跨音频、文本、图像和视频等多种模态的微调与 RAG。
适用人群
希望优化视觉与多模态模型在性能、大小和内存效率方面表现,或将其定制用于特定视觉任务的 AI 开发者和研究人员。
主要亮点
- 全面优化: 涵盖量化、知识蒸馏和
torch.compile以实现加速。 - VLM 定制: 提供基于事实的微调和针对 OCR 与文档问答的专用 VLM 微调配方。
- 多模态 RAG: 提供多模态文档检索与生成的工作流。
- 任意模态到任意模态能力: 支持跨音频、文本、图像和视频模态的微调与 RAG。
相关
- 项目
- 项目
- 项目
- 项目
- 项目