NVIDIA-AI-Blueprints/llm-router

Route LLM requests to the best model for the task at hand.

解決的問題

現代AI系統經常面臨準確度、速度與成本之間的權衡。本專案提供一個路由器,透過分析使用者提示(文字或多模態)來自動化這些權衡,並為任務推薦最適合的LLM或視覺語言模型(VLM),確保每個特定請求都使用最有效率的模型。

工作原理

該系統由基於NVIDIA NeMo Agent Toolkit建構的路由器後端組成,提供與OpenAI相容的API。它採用兩種不同的路由策略:

  1. 意圖導向路由:使用小型LLM(Qwen 1.7B)對使用者意圖(例如「影像理解」或「難題」)進行分類,並將該意圖對應至預先設定的模型。
  2. 自動路由:使用CLIP嵌入對文字與影像進行編碼,再透過訓練好的神經網路,根據品質、延遲與成本指標預測最適模型。

與早期版本不同,此路由器不會代理請求;它僅回傳推薦的模型名稱,由呼叫應用程式負責執行該模型的API呼叫。

適用對象

  • AI工程師與開發者:正在探索多模態路由方法的人。
  • MLOps團隊:希望實作學習型路由優化與自訂模型選擇策略的團隊。
  • 研究團隊:正在評估不同路由策略以用於生產部署的人。

主要亮點

  • 多模態支援:能根據文字與影像輸入進行路由。
  • 兩種路由策略:同時提供零樣本意圖分類與資料驅動的神經網路路由。
  • OpenAI API相容:透過標準的聊天補全端點回傳模型推薦。
  • 彈性設定:允許使用者更新意圖對應或在其自有資料上訓練自訂神經網路路由器。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案