roboflow/maestro

streamline the fine-tuning process for multimodal models: PaliGemma 2, Florence-2, and Qwen2.5-VL

What it solves

Maestro 简化了微调多模态(视觉语言)模型的复杂过程。它消除了编写重复性样板代码进行配置、数据加载和训练循环设置的需求,让开发者能够专注于其特定任务。

How it works

Maestro 提供了一个统一的 CLI 和 Python SDK,封装了训练的最佳实践。它使用一致的 JSONL 数据格式来简化数据处理,并为特定模型提供即插即用的配方(recipes)。它支持 LoRA、QLoRA 和图形冻结(graph freezing)来降低硬件需求。

Who it’s for

开发者和 AI 研究人员,希望快速微调 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等视觉语言模型(VLMs)以执行目标检测和 JSON 数据提取等任务。

Highlights

  • Broad Model Support: 为 Florence-2、PaliGemma 2 和 Qwen2.5-VL 提供即插即用的配方。
  • Flexible Interface: 可以通过命令行界面或 Python API 启动,以获得更多控制权。
  • Efficient Training: 支持 LoRA、QLoRA 和图形冻结(graph freezing)以降低内存占用。
  • wysokie-level abstraction: 自动处理可重现性、数据准备和训练循环设置。