mkturkcan/DART

Detect Anything in Real Time: Real-time object detection using frontier object detection models.

何を解決するか

DARTは、Segment Anything Model 3 (SAM3)をリアルタイム、マルチクラス、オープンボキャブラリーの検出器に変換します。ベースモデルの再学習を必要とせずに、高速な物体検出(ボックスとスコア)を可能にすることで、大規模なビジョンモデルのレイテンシの問題に対処します。

仕組み

DARTは、モデルを2つの独立したTensorRT FP16エンジンに分割する、トレーニング不要のフレームワークを使用します:バックボーン(例:ViT-H/14)とエンコーダー・デコーダーです。テキストエンコーダーはPyTorch内に留まり、GPUに埋め込みをキャッシュすることで、ユーザーがターゲットクラスをミリ秒単位で変更できるようにします。さらに速度を向上させるために、このプロジェクトは蒸留されたスチューデント・バックボーン(RepViTやTinyViTなど)を提供し、計算負荷を軽減するためにブロック・プルーニング(ブロック全体の削除またはサブブロックのマスキング)をサポートしています。

対象者

GPU上でのリアルタイムなオープンボキャブラリー検出を必要とするコンピュータビジョン開発者およびエンジニア、特にTensorRTを使用して最適化を行うNVIDIAハードウェア(RTX 4080、Jetson AGX Orin)をターゲットにしている人々です。

ハイライト

  • リアルタイム性能: 1008pxの解像度で4クラスの場合、単一のRTX 4080上で最大15.8 FPSを実現します。
  • オープンボキャブラリー: 再学習なしで、テキストプロンプトを介してユーザーが指定した任意のクラスを検出します。
  • 柔軟なバックボーン: 品質と速度のトレードオフに合わせて、完全なViT-H、プルーニング版、および蒸留されたスチューデント・モデル(RepViT、TinyViT、EfficientViT)をサポートします。
  • 最適化スイート: ブロック・プルーニング分析、品質回復のための自己蒸留、およびTensorRTエクスポート・スクリプトが含まれています。
  • ビデオサポート: レイテンシを低減するためのフレーム間パイプライン処理、およびマルチオブジェクト・トラッキングのための統合されたByteTrackを特徴としています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト