merveenoyan/smol-vision

Recipes for shrinking, optimizing, customizing cutting edge vision models. 💜

解决的问题

Smol Vision 提供了一系列用于缩小、优化和定制前沿视觉与多模态 AI 模型的配方。它解决了大型视觉语言模型(VLM)和基础模型在小型硬件或特定任务上部署时效率低下的挑战。

如何工作

该项目由一系列笔记本和脚本组成,展示了各种优化和微调技术:

  • 优化: 使用 🤗 Optimum、ONNX Runtime 和 Quanto 等工具进行量化和图优化,以减小模型大小并降低延迟。
  • 微调: 提供 PaliGemma、Florence-2、IDEFICS3 和 SmolVLM 等模型在特定数据集(如 VQAv2、DocVQA)上的 QLoRA 和全量微调配方。
  • 多模态 RAG: 使用 ColPali 和 Qwen2-VL 实现检索增强生成,无需复杂处理即可检索文档。
  • 任意模态到任意模态(Any-to-Any): 使用 Gemma-3n 和 OmniEmbed 等模型,演示跨音频、文本、图像和视频等多种模态的微调与 RAG。

适用人群

希望优化视觉与多模态模型在性能、大小和内存效率方面表现,或将其定制用于特定视觉任务的 AI 开发者和研究人员。

主要亮点

  • 全面优化: 涵盖量化、知识蒸馏和 torch.compile 以实现加速。
  • VLM 定制: 提供基于事实的微调和针对 OCR 与文档问答的专用 VLM 微调配方。
  • 多模态 RAG: 提供多模态文档检索与生成的工作流。
  • 任意模态到任意模态能力: 支持跨音频、文本、图像和视频模态的微调与 RAG。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目