NVIDIA-AI-Blueprints/llm-router
Route LLM requests to the best model for the task at hand.
何を解決するか
現代のAIシステムは、精度、速度、コストの間でトレードオフに直面することが多いです。このプロジェクトは、ユーザーのプロンプト(テキストまたはマルチモーダル)を分析し、タスクに最も適したLLMまたはビジョン・ランゲージモデル(VLM)を推奨することで、これらのトレードオフを自動化するルーターを提供します。これにより、各リクエストに対して最も効率的なモデルが使用されるようになります。
動作方法
このシステムは、NVIDIA NeMo Agent Toolkitに基づくルーター・バックエンドで構成されており、OpenAI互換APIを公開しています。2つの異なるルーティング戦略を採用しています:
- 意図ベースルーティング:小規模なLLM(Qwen 1.7B)を使用してユーザーの意図(例:"画像理解"や"難しい質問")を分類し、その意図を事前に設定されたモデルにマッピングします。
- 自動ルーティング:CLIP埋め込みを使ってテキストと画像をエンコードし、それをトレーニング済みのニューラルネットワークに通して、品質、レイテンシ、コストの指標に基づいて最適なモデルを予測します。
以前のバージョンとは異なり、このルーターはリクエストをプロキシしません。代わりに推奨されるモデル名を返し、呼び出しアプリケーションがそのモデルへのAPIコールを実行する責任を持ちます。
対象ユーザー
- AIエンジニアおよび開発者:マルチモーダルルーティングアプローチを検討している人。
- MLOpsチーム:学習ベースのルーティング最適化やカスタムモデル選択戦略を実装したいチーム。
- 研究チーム:本番環境へのデプロイを検討するための異なるルーティング戦略を評価している人。
特徴
- マルチモーダル対応:テキストと画像の両方の入力に基づいたルーティングが可能。
- 2つのルーティング戦略:ゼロショット意図分類とデータ駆動型ニューラルネットワークルーティングの両方を提供。
- OpenAI API準拠:標準のチャットコンプリーションエンドポイントを通じてモデル推奨を返す。
- 柔軟な設定:意図マッピングの更新や、独自データ上でカスタムニューラルネットワークルーターのトレーニングが可能。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト