NVIDIA-AI-IOT/Lidar_AI_Solution
A project demonstrating Lidar related AI solutions, including three GPU accelerated Lidar/camera DL networks (PointPillars, CenterPoint, BEVFusion) and the related libs (cuPCL, 3D SparseConvolution, YUV2RGB, cuOSD,).
解決する課題
このプロジェクトは、自動運転車両における3D Lidarベースの知覚のために、高度に最適化されたCUDAおよびTensorRT実装スイートを提供します。疎な畳み込み、点群処理、およびマルチモーダルセンサーフュージョン(Lidarおよびカメラ)に関連するパフォーマンスのボトルネックを解消し、NVIDIAハードウェア上での高速な推論とメモリ使用量の削減を実現します。
仕組み
このソリューションは、いくつかの特化したコンポーネントを実装しています:
- 推論エンジン: CenterPoint、BEVFusion、PointPillarsなどの一般的な3D検出アーキテクチャ向けに最適化されたCUDAカーネルとTensorRT統合。
- 疎な畳み込み: TensorRTとは独立して動作し、INT8/FP16精度を使用する3D疎な畳み込みネットワーク専用の軽量推論エンジン。
- 点群ライブラリ (cuPCL): 点群のレジストレーション (ICP, NDT)、フィルタリング、セグメンテーション、およびクラスタリングのためのGPU加速操作。
- データパイプライン: 生のセンサーデータをAIモデル用に準備するための、YUVからRGBへの変換、ROI処理、およびボクセル化のための高性能カーネル。
- 可視化: GPUカーネルを介してバウンディングボックスやテキストを直接描画するための、CUDAベースのオンスクリーンディスプレイ (cuOSD) ライブラリ。
対象者
これは、NVIDIA GPU上で高性能なLidarベースのAIモデルをデプロイする必要がある、自動運転システム、ロボティクス、および3D知覚に従事するエンジニアや研究者向けに設計されています。
ハイライト
- 最適化されたアーキテクチャ: BEVFusion、CenterPoint、PointPillarsの高忠実度な実装。
- メモリ効率: 疎な畳み込みにおける低いメモリフットプリント (約422-426MB)。
- ハードウェア加速: 前処理、後処理、および可視化にCUDAカーネルを広範に使用し、CPU-GPU間のデータ転送を最小限に抑えます。
- 量子化サポート: 事後量子化 (PTQ) および量子化認識トレーニング (QAT) ソリューションを含む。
- 統合ツール: GPU加速点群ライブラリ (cuPCL) と高速画像変換ユーティリティを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト