mkturkcan/DART

Detect Anything in Real Time: Real-time object detection using frontier object detection models.

它解決的問題

DART 將 Segment Anything Model 3 (SAM3) 轉換為即時、多類別、開放詞彙的偵測器。它透過在不需重新訓練基礎模型的情況下,實現高速物件偵測(方框與分數),解決大型視覺模型的延遲問題。

如何運作

DART 使用免訓練框架,將模型拆分為兩個獨立的 TensorRT FP16 引擎:主幹(例如 ViT-H/14)與編碼器-解碼器。文字編碼器保留在 PyTorch 中,並將嵌入向量快取至 GPU,使使用者能在毫秒內更換目標類別。為了進一步提升速度,本專案提供蒸餾後的學生主幹(如 RepViT 或 TinyViT),並支援區塊剪枝(移除整個區塊或遮罩子區塊),以降低運算負載。

適用對象

需要在 GPU 上進行即時開放詞彙偵測的電腦視覺開發者與工程師,特別是針對 NVIDIA 硬體(RTX 4080、Jetson AGX Orin)使用 TensorRT 進行優化的使用者。

主要特色

  • 即時效能:在單一 RTX 4080 上,於 1008px 分辨率下對 4 個類別達成最高 15.8 FPS。
  • 開放詞彙:透過文字提示偵測使用者指定的任何類別,無需重新訓練。
  • 彈性主幹:支援完整的 ViT-H、剪枝版本以及蒸餾學生模型(RepViT、TinyViT、EfficientViT),以因應不同品質與速度的權衡需求。
  • 優化工具組:包含區塊剪枝分析工具、自我蒸餾以恢復品質,以及 TensorRT 匯出指令碼。
  • 影片支援:具備跨幀流水線技術以降低延遲,並整合 ByteTrack 以實現多物件追蹤。

相關

  • 專案
  • 專案
  • 專案
  • 專案