mkturkcan/DART
Detect Anything in Real Time: Real-time object detection using frontier object detection models.
它解决了什么问题
DART 将 Segment Anything Model 3 (SAM3) 转换为实时、多类别、开放词汇的检测器。它通过启用高速目标检测(边界框和得分)来解决大型视觉模型的延迟问题,且无需重新训练基础模型。
它如何工作
DART 使用无需训练的框架,将模型拆分为两个独立的 TensorRT FP16 引擎:主干网络(例如 ViT-H/14)和编码器-解码器。文本编码器保留在 PyTorch 中,并将嵌入向量缓存到 GPU,使用户可在毫秒内更改目标类别。为进一步提升速度,该项目提供了蒸馏后的学生主干网络(如 RepViT 或 TinyViT),并支持块剪枝(移除整个块或掩码子块),以减少计算负载。
适用人群
需要在 GPU 上实现实时开放词汇检测的计算机视觉开发者和工程师,特别是使用 TensorRT 优化并针对 NVIDIA 硬件(如 RTX 4080、Jetson AGX Orin)的用户。
主要亮点
- 实时性能:在单个 RTX 4080 上,1008px 分辨率下对 4 个类别实现高达 15.8 FPS。
- 开放词汇:通过文本提示检测用户指定的任意类别,无需重新训练。
- 灵活的主干网络:支持完整的 ViT-H、剪枝版本以及蒸馏的学生模型(RepViT、TinyViT、EfficientViT),适用于不同质量与速度的权衡。
- 优化工具套件:包含块剪枝分析工具、用于质量恢复的自蒸馏方法以及 TensorRT 导出脚本。
- 视频支持:支持帧间流水线以降低延迟,并集成 ByteTrack 实现多目标跟踪。
相关
- 项目
- 项目
- 项目
- 项目