roboflow/maestro
streamline the fine-tuning process for multimodal models: PaliGemma 2, Florence-2, and Qwen2.5-VL
What it solves
Maestro 簡化了微調多模態(視覺語言)模型的複雜過程。它消除了為配置、數據加載和訓練循環設置而編寫重複性樣板代碼的需求,讓開發者能夠專注於其特定任務。
How it works
Maestro 提供了一個統一的 CLI 和 Python SDK,封裝了訓練的最佳實踐。它使用一致的 JSONL 數據格式來簡化數據處理,並為特定模型提供即插即用的配方(recipes)。它支持 LoRA、QLoRA 和圖形凍結(graph freezing)等高效訓練技術,以降低硬件需求。
Who it’s for
開發者和 AI 研究人員,希望快速微調 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等視覺語言模型(VLMs)以執行對象物體檢測和 JSON 數據提取等任務。
Highlights
- Broad Model Support: Florence-2、PaliGemma 2 和 Qwen2.5-VL 的即插即用配方。
- Flexible Interface: 可以通過命令行界面或 Python API 進行啟動,以獲得更多控制權。
- Efficient Training: 支持 LoRA、QLoRA 和圖形凍結(graph freezing)以降低內存佔用。
- wysokie-level abstraction: 自動處理可重現性、數據準備和訓練循環設置。 "}} ,