vllm-project/semantic-router

A programmable Mixture-of-Models router for heterogeneous LLM inference

解决的问题

vLLM Semantic Router 旨在解决 LLM 基础设施碎片化的问题。与其将路由逻辑硬编码到应用程序中,它提供了一个可编程层,使开发者能够管理「模型混合(Mixture-of-Models)」系统。通过根据特定信号和策略为每个请求选择合适的模型路径,从而优化质量、成本、延迟和隐私。

工作原理

该系统作为路由层,评估请求信号、用户偏好和应用策略,以选择或组合模型路径。它可以在异构计算环境中路由请求,包括 GPU、加速器、边缘设备和云基础设施,同时保持数据边界以确保隐私。

适用对象

适用于在不同硬件和位置(边缘、私有、云)上使用多个模型构建复杂 LLM 应用的开发者和组织,需要一种可编程方式来管理请求如何路由到这些模型。

主要亮点

  • 可编程路由: 通过策略执行模型选择,避免硬编码逻辑。
  • 异构计算支持: 支持在 GPU、加速器、边缘和云的混合环境中路由。
  • 模型混合: 可为不同工作负载组合个性化的模型路径。
  • 隐私感知: 在路由过程中能够将数据保留在特定边界内。

相关