lightly-ai/lightly-train
All-in-one training for vision models (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distillation.
解決的問題
LightlyTrain 是一個旨在簡化最先進電腦視覺模型創建過程的框架。它透過提供各種視覺任務的預訓練、微調和蒸餾工具,解決了從原始無標籤數據到部署模型的轉換難題。
工作原理
該框架支援整個模型開發生命週期:
- Pretraining: 使用者可以在無標籤數據上預訓練視覺基礎模型(如 DINOv2/v3)。
- Fine-tuning: 它提供針對特定任務訓練模型的專業方法,包括目標檢測、實例分割、語義分割和全景分割。
- Distillation: 它包含建立更小、更高效模型(例如 Distillationv3)的方法,這些模型在不同架構(ViTs, CNNs, hybrids)上都能保持高性能。
- Deployment: 該框架支援將模型匯出為 ONNX 和 TensorRT(包括 FP16 精度),以便在邊緣裝置上進行更快的推理。
適用對象
它是為需要為生產或邊緣部署訓練高性能電腦視覺模型的機器學習工程師和研究人員而構建的,特別是那些使用基於 Transformer 的骨幹網路(如 DINOv2/v3 和 EdgeCrafter ECViT)的人員。
亮點
- 全面的任務支援:內建目標檢測、實例分割、語義分割、全景分割和單目深度估計的工作流。
- 邊緣就緒:直接支援匯出至 ONNX 和 TensorRT,適用於低功耗嵌入式裝置。
- SOTA 架構:整合了 DINOv2、DINOv3 以及來自 CVPR 2025 的 EoMT 方法。
- 高效的模型縮放:將大型基礎模型蒸餾為微型、高性能模型(例如 PicoDet)的工具。