vLLM Semantic Router: 通过微智能体协作提升模型性能

vLLM Semantic Router: 通过微智能体协作提升模型性能

vLLM 已引入 Semantic Router,这是一个服务层原语,允许单个模型 API 调用触发多个模型的有限协作,实际上将一个模型团队视为单一模型身份。通过选择特定任务的协作“食谱”,此方法使系统能够匹配或超过前沿模型的性能,而无需应用层管理复杂的智能体图。

Semantic Router 作为能力层

与其作为后端的被动透传,不如说 vLLM Semantic Router 作为一个主动控制平面。它将路由器的传统角色——以前专注于成本降低、安全策略执行和云边缘协调——转变为构建能力的工具。

通过使用稳定的模型身份(例如 vllm-sr/auto),路由器可以执行复杂的内部进程——包括向工作器扇出、收集法定人数、验证分歧以及合成最终答案——同时向用户返回标准的 OpenAI 兼容响应。这将多模型协作的复杂性从应用层抽离到服务基础设施。

Looper:微智能体的执行运行时

在 Semantic Router 的核心是“looper”,一个管理有限微智能体的运行时。当请求进入路由器时,它会被投射到任务形状或风险带中,以确定适当的 looper 算法。主要的 looper 模式包括:

  • Confidence: 成本感知的顺序升级循环。它首先尝试更便宜的模型,只有在置信度分数(来源于对数概率、自验证或蕴含验证器)低于特定阈值时才会升级到更昂贵的候选模型。
  • Ratings: 受控集成循环,最多启动 max_concurrent 个并行候选者,使用评分感知的权重聚合结果。
  • ReMoM (Repeated Mixture-of-Model): 侧重推理的循环,扇出多次尝试,等待最小成功法定人数,并使用合成模型将证据合并为最终输出契约。
  • Fusion: 将分歧视为信号的模式。独立的小组答案提供给裁判和最终确定者,他们分析矛盾和独特见解以产生最终响应。
  • Workflows: 支持静态角色或动态规划器的有限智能体运行时。它在步骤、并行度和超时的严格限制内执行工作步骤,以确保系统受基础设施管控,而不是成为无限制的自主智能体。

任务塑造的食谱以实现优化性能

通过将协作模式匹配到任务的具体需求来实现性能提升。vLLM 断言最佳循环是“任务塑造的”,这意味着不同的基准需要不同的食谱:

  • GPQA-Diamond: 使用 ReMoM 食谱,严格保持 ANSWER: X 格式,用于硬科学多选题。
  • LiveCodeBench: 采用代码塑造的循环,评估约束、起始代码和隐藏测试风险。
  • Humanity's Last Exam (HLE): 基于形式推理和分歧风险,在更深的 ReMoM、更小的 Fusion 或回退路径之间进行选择。

基准性能

评估表明,路由器拥有的协作可以创建比任何单个模型调用更强的模型身份。以下结果比较 VSR Closed(仅使用闭源模型后端)和 VSR Hybrid(混合开源和闭源模型):

基准 VSR 行 分数 参考基线
LiveCodeBench (Jan-Apr 2025) VSR Closed 92.6 Fugu Ultra (92.0), GPT-5.5 (90.7), Opus 4.8 (90.3)
GPQA-Diamond VSR Closed 96.0 Fugu Ultra (95.5), Gemini 3.1 Pro (94.3), GPT-5.5 (93.6)
Humanity's Last Exam VSR Closed 50.0 Fugu Ultra (50.0), Gemini 3.1 Pro (45.0)
Humanity's Last Exam VSR Hybrid 47.1 Qwen3.7 Max (41.4), GPT-5.5 (41.4)

对模型服务基础设施的影响

这一转将模型服务从被动堆栈移动到主动堆栈。路由器现在管理微智能体编排的基本组件:模型别名、提供商策略、凭据、成本元数据和响应语义。通过将这些能力集成到服务层,vLLM 使系统能够在不更改客户端集成的情况下提升其推理能力和效率。

Sources