mkturkcan/DART
Detect Anything in Real Time: Real-time object detection using frontier object detection models.
何を解決するか
DARTは、Segment Anything Model 3 (SAM3)をリアルタイム、マルチクラス、オープンボキャブラリーの検出器に変換します。ベースモデルの再学習を必要とせずに、高速な物体検出(ボックスとスコア)を可能にすることで、大規模なビジョンモデルのレイテンシの問題に対処します。
仕組み
DARTは、モデルを2つの独立したTensorRT FP16エンジンに分割する、トレーニング不要のフレームワークを使用します:バックボーン(例:ViT-H/14)とエンコーダー・デコーダーです。テキストエンコーダーはPyTorch内に留まり、GPUに埋め込みをキャッシュすることで、ユーザーがターゲットクラスをミリ秒単位で変更できるようにします。さらに速度を向上させるために、このプロジェクトは蒸留されたスチューデント・バックボーン(RepViTやTinyViTなど)を提供し、計算負荷を軽減するためにブロック・プルーニング(ブロック全体の削除またはサブブロックのマスキング)をサポートしています。
対象者
GPU上でのリアルタイムなオープンボキャブラリー検出を必要とするコンピュータビジョン開発者およびエンジニア、特にTensorRTを使用して最適化を行うNVIDIAハードウェア(RTX 4080、Jetson AGX Orin)をターゲットにしている人々です。
ハイライト
- リアルタイム性能: 1008pxの解像度で4クラスの場合、単一のRTX 4080上で最大15.8 FPSを実現します。
- オープンボキャブラリー: 再学習なしで、テキストプロンプトを介してユーザーが指定した任意のクラスを検出します。
- 柔軟なバックボーン: 品質と速度のトレードオフに合わせて、完全なViT-H、プルーニング版、および蒸留されたスチューデント・モデル(RepViT、TinyViT、EfficientViT)をサポートします。
- 最適化スイート: ブロック・プルーニング分析、品質回復のための自己蒸留、およびTensorRTエクスポート・スクリプトが含まれています。
- ビデオサポート: レイテンシを低減するためのフレーム間パイプライン処理、およびマルチオブジェクト・トラッキングのための統合されたByteTrackを特徴としています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト