lightly-ai/lightly-train

All-in-one training for vision models (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distillation.

解决的问题

LightlyTrain 是一个旨在简化最先进计算机视觉模型创建过程的框架。它通过提供各种视觉任务的预训练、微调和蒸馏工具,解决了从原始无标签数据到部署模型的转换难题。

工作原理

该框架支持整个模型开发生命周期:

  • Pretraining: 用户可以在无标签数据上预训练视觉基础模型(如 DINOv2/v3)。
  • Fine-tuning: 它提供针对特定任务训练模型的专业方法,包括目标检测、实例分割、语义分割和全景分割。
  • Distillation: 它包含创建更小、更高效模型(例如 Distillationv3)的方法,这些模型在不同架构(ViTs, CNNs, hybrids)上都能保持高性能。
  • Deployment: 该框架支持将模型导出为 ONNX 和 TensorRT(包括 FP16 精度),以便在边缘设备上进行更快的推理。

适用对象

它是为需要为生产或边缘部署训练高性能计算机视觉模型的机器学习工程师和研究人员而构建的,特别是那些使用基于 Transformer 的骨干网络(如 DINOv2/v3 和 EdgeCrafter ECViT)的人员。

亮点

  • 全面的任务支持:内置目标检测、实例分割、语义分割、全景分割和单目深度估计的工作流。
  • 边缘就绪:直接支持导出到 ONNX 和 TensorRT,适用于低功耗嵌入式设备。
  • SOTA 架构:集成了 DINOv2、DINOv3 以及来自 CVPR 2025 的 EoMT 方法。
  • 高效的模型缩放:将大型基础模型蒸馏为微型、高性能模型(例如 PicoDet)的工具。