triton-inference-server/server
The Triton Inference Server provides an optimized cloud and edge inferencing solution.
何を解決するか
Triton Inference Server は、NVIDIA GPU、x86/ARM CPU、AWS Inferentia などのさまざまなハードウェアプラットフォーム上で、PyTorch、TensorRT、ONNX、OpenVINO などの複数のフレームワークからの AI モデルを標準化された方法で配信するための手段を提供し、AI モデルのデプロイを簡素化します。
動作方法
モデルリポジトリを管理する推論サーバーソフトウェアとして機能します。モジュール式のバックエンドアーキテクチャを採用しており、異なるディープラーニングおよび機械学習フレームワークからのモデル実行が可能になります。HTTP/REST および gRPC などの複数の推論プロトコルをサポートし、プロセス内での利用を目的とした C および Java API を提供します。
対象ユーザー
クラウド、データセンター、エッジ、組み込みデバイスのあらゆる環境で、最適化されたパフォーマンスを実現する本番用 AI モデルをデプロイする必要がある AI チームおよび開発者。
主な特徴
- 複数フレームワーク対応: TensorRT、PyTorch、ONNX、OpenVINO、Python、RAPIDS FIL からのモデルを配信可能。
- パフォーマンス最適化: ダイナミックバッチ処理、シーケンスバッチ処理、並列モデル実行により、スループットを最大化し、レイテンシを最小限に抑えます。
- 柔軟なデプロイ: クラウド、データセンター、エッジ、組み込みデバイスに対応。
- モデルパイプライン: エンセンブルとビジネスロジックスクリプティング(BLS)により、複雑なワークフローを実現可能。
- 拡張性: C/C++ または Python でカスタムバックエンドを作成できる Backend API を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト