NVIDIA-AI-Blueprints/llm-router

Route LLM requests to the best model for the task at hand.

解决的问题

现代AI系统常常面临精度、速度和成本之间的权衡。本项目提供了一个路由器,通过分析用户提示(文本或多模态)来自动权衡这些因素,并为任务推荐最合适的LLM或视觉语言模型(VLM),确保每个具体请求都使用最高效的模型。

工作原理

该系统由基于NVIDIA NeMo Agent Toolkit构建的路由器后端组成,提供与OpenAI兼容的API。它采用两种不同的路由策略:

  1. 基于意图的路由:使用小型LLM(Qwen 1.7B)对用户意图(例如“图像理解”或“难题”)进行分类,并将该意图映射到预配置的模型。
  2. 自动路由:使用CLIP嵌入对文本和图像进行编码,然后通过训练好的神经网络,基于质量、延迟和成本指标预测最优模型。

与早期版本不同,此路由器不代理请求;它仅返回推荐的模型名称,由调用应用程序负责向该模型执行API调用。

适用人群

  • AI工程师和开发者:正在探索多模态路由方法的人。
  • MLOps团队:希望实现基于学习的路由优化和自定义模型选择策略的团队。
  • 研究团队:正在评估不同路由策略以用于生产部署的人。

主要亮点

  • 多模态支持:能够基于文本和图像输入进行路由。
  • 两种路由策略:同时提供零样本意图分类和数据驱动的神经网络路由。
  • OpenAI API兼容:通过标准的聊天补全端点返回模型推荐。
  • 灵活配置:允许用户更新意图映射或在其自有数据上训练自定义神经网络路由器。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目