lightly-ai/lightly-train
All-in-one training for vision models (YOLO, ViTs, RT-DETR, DINOv3): pretraining, fine-tuning, distillation.
해결하는 문제
LightlyTrain은 최첨단 컴퓨터 비전 모델의 제작을 간소화하기 위해 설계된 프레임워크입니다. 다양한 비전 작업에 걸친 사전 학습, 미세 조정 및 증류를 위한 도구를 제공함으로써, 라벨이 없는 원시 데이터에서 배포 가능한 모델로 전환하는 과정의 어려움을 해결합니다.
작동 방식
이 프레임워크는 전체 모델 개발 라이프사이클을 지원합니다:
- Pretraining: 사용자는 라벨이 없는 데이터로 비전 파운데이션 모델(DINOv2/v3 등)을 사전 학습할 수 있습니다.
- Fine-tuning: 객체 탐지, 인스턴스 세그멘테이션, 시맨틱 세그멘테이션, 파놉틱 세그멘테이션을 포함한 특정 작업에 대해 모델을 훈련하기 위한 전문적인 방법을 제공합니다.
- Distillation: 다양한 아키텍처(ViTs, CNNs, hybrids)에서 높은 성능을 유지하는 더 작고 효율적인 모델(예: Distillationv3)을 생성하는 방법이 포함되어 있습니다.
- Deployment: 에지 장치에서 더 빠른 추론을 위해 ONNX 및 TensorRT(FP16 정밀도 포함)로 모델을 내보내는 것을 지원합니다.
대상
이 프레임워크는 프로덕션 또는 에지 배포를 위해 고성능 컴퓨터 비전 모델을 훈련해야 하는 머신러닝 엔지니어 및 연구자, 특히 DINOv2/v3 및 EdgeCrafter ECViT와 같은 트랜스포머 기반 백본을 사용하는 분들을 위해 구축되었습니다.
주요 특징
- 포괄적인 작업 지원: 객체 탐지, 인스턴스 세그멘테이션, 시맨틱 세그멘테이션, 파놉틱 세그멘테이션 및 단안 깊이 추정을 위한 내장 워크플로우.
- 에지 최적화: 저전력 임베디드 장치를 위한 ONNX 및 TensorRT 내보내기 직접 지원.
- SOTA 아키텍처: DINOv2, DINOv3 및 CVPR 2025의 EoMT 방법과 통합.
- 효율적인 모델 스케일링: 대규모 파운데이션 모델을 작고 고성능인 모델(예: PicoDet)로 증류하기 위한 도구.