mkturkcan/DART
Detect Anything in Real Time: Real-time object detection using frontier object detection models.
해결하는 문제
DART는 Segment Anything Model 3(SAM3)을 실시간, 다중 클래스, 오픈-보이지 않는 감지기로 변환합니다. 대규모 비전 모델의 지연 문제를 해결하기 위해 기존 기반 모델의 재학습 없이도 고속 객체 감지(박스 및 점수)를 가능하게 합니다.
작동 방식
DART는 학습 없이 모델을 두 개의 별도 TensorRT FP16 엔진으로 분할하는 프레임워크를 사용합니다: 백본(e.g., ViT-H/14)과 인코더-디코더입니다. 텍스트 인코더는 PyTorch에 유지되며 GPU에 임베딩을 캐시하여 사용자가 타겟 클래스를 밀리초 내에 변경할 수 있도록 합니다. 더 빠른 속도를 위해 프로젝트는 교육된 학생 백본(예: RepViT 또는 TinyViT)을 제공하며, 전체 블록 제거 또는 하위 블록 마스킹을 통한 블록 프루닝을 지원하여 계산 부담을 줄입니다.
대상 사용자
GPU에서 실시간 오픈-보이지 않는 감지가 필요한 컴퓨터 비전 개발자 및 엔지니어로, 특히 NVIDIA 하드웨어(RTX 4080, Jetson AGX Orin)를 사용하고 TensorRT를 최적화 도구로 활용하는 사용자를 대상으로 합니다.
주요 특징
- 실시간 성능: 단일 RTX 4080에서 1008px 해상도, 4개 클래스 기준 최대 15.8 FPS를 달성합니다.
- 오픈-보이지 않는 감지: 재학습 없이 사용자 지정 텍스트 프롬프트를 통해 어떤 클래스든 감지할 수 있습니다.
- 유연한 백본: ViT-H 전체, 프루닝된 버전, 교육된 학생 모델(RepViT, TinyViT, EfficientViT)을 지원하여 다양한 품질-속도 트레이드오프를 제공합니다.
- 최적화 도구 모음: 블록 프루닝 분석, 품질 회복을 위한 자기 교육(self-distillation), TensorRT 내보내기 스크립트를 포함합니다.
- 비디오 지원: 프레임 간 파이프라인을 통해 지연 시간을 줄이고, 멀티 오브젝트 추적을 위한 ByteTrack을 통합합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트