lightly-ai/lightly-train

All-in-one training for vision models (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distillation.

解決する課題

LightlyTrainは、最先端のコンピュータビジョンモデルの作成を効率化するために設計されたフレームワークです。ラベルなしの生データからデプロイ可能なモデルへの移行という困難に対し、さまざまなビジョンタスクにおける事前学習、微調整、蒸留のためのツールを提供することで対応します。

仕組み

このフレームワークは、モデル開発のライフサイクル全体をサポートします:

  • Pretraining: ユーザーはラベルなしデータを使用して、ビジョン基盤モデル(DINOv2/v3など)を事前学習できます。
  • Fine-tuning: 物体検出、インスタンスセグメンテーション、セマンティックセグメンテーション、パノプティックセグメンテーションを含む、特定のタスク向けにモデルをトレーニングするための専門的な手法を提供します。
  • Distillation: さまざまなアーキテクチャ(ViTs、CNNs、ハイブリッド)において高いパフォーマンスを維持する、より小さく効率的なモデル(例:Distillationv3)を作成するための手法が含まれています。
  • Deployment: エッジデバイスでの推論を高速化するため、ONNXおよびTensorRT(FP16精度を含む)へのモデルのエクスポートをサポートしています。

対象者

本フレームワークは、本番環境やエッジデバイスへのデプロイに向けて高性能なコンピュータビジョンモデルをトレーニングする必要がある機械学習エンジニアや研究者、特にDINOv2/v3やEdgeCrafter ECViTのようなTransformerベースのバックボーンを扱う方を対象としています。

ハイライト

  • 包括的なタスクサポート: 物体検出、インスタンスセグメンテーション、セマンティックセグメンテーション、パノプティックセグメンテーション、単眼深度推定のための組み込みワークフロー。
  • エッジ対応: 低電力の組み込みデバイス向けに、ONNXおよびTensorRTエクスポートを直接サポート。
  • SOTAアーキテクチャ: DINOv2、DINOv3、およびCVPR 2025のEoMT手法との統合。
  • 効率的なモデルスケーリング: 巨大な基盤モデルを、非常に小さく高性能なモデル(例:PicoDet)へと蒸留するためのツール。