超越单一模型:使用 vLLM Semantic Router 构建混合模型 (Mixture-of-Models) 系统
超越单一模型:使用 vLLM Semantic Router 构建混合模型 (Mixture-of-Models) 系统
TL;DR
vLLM Semantic Router 增加了对混合模型 (Mixture-of-Models, MoM) 系统的支持,将碎片化的模型、计算、位置和偏好挑战转化为一个内部模型系统,在后台编排独立模型的同时,呈现一个版本化的单一模型身份。
背景与动机
模型、计算、位置和用户偏好的碎片化迫使每个应用程序必须自行协调这些差异。将模型边界扩展到包含智能分配,使分配成为模型的一部分,从而将碎片化限制在系统内部。
vLLM Semantic Router 的演进
从 2025 年 4 月的孵化阶段到 2026 年 6 月的 Themis 版本,vLLM‑SR 从简单的意图感知路由演进为具有投影 (projections)、重放 (replay) 和协议支持的有状态、会话感知控制。Iris 版本引入了可组合路由和 MoM 模型家族;Athena 增加了模型选择、内存、RAG、多模态和操作仪表板;Themis 将系统转变为一个可操作的契约,具有会话感知代理路由、可重放的追踪和跨硬件支持。
什么是混合模型 (Mixture-of-Models)
混合模型是一种版本化的复合模型,其引擎通过跨独立模型和算子的、受偏好约束且受资源限制的路径来实现每个请求,并通过一个模型接口呈现并返回一个可归因的结果。与混合专家模型 (Mixture-of-Experts, MoE) 不同,MoM 协调的是在架构、所有者、许可、模态、协议、上下文窗口和硬件方面可能存在差异的独立模型;一个 MoE 检查点可以作为 MoM 的一个组件。
| 维度 | 传统模型 | 混合模型 (MoM) |
|---|---|---|
| 智能单元 | 单个检查点 | 一个受管理的模型系统 |
| 专业化 | 主要编码在权重中 | 通过独立的专家进行组合 |
| 执行 | 单条生成路径 | 选择、级联、验证、融合或工作流 |
| 优化目标 | 单个模型的质量和效率 | 跨质量、成本、延迟、安全性、隐私和能耗的系统前沿 |
| 部署边界 | 单个运行时 | 云、数据中心和边缘 |
| 用户契约 | 单个模型身份 | 单个模型身份 |
为什么模型边界必须移动
模型、计算、位置和用户偏好各自分散;没有单一模型能在所有维度上都胜出。如今,每个应用程序都必须将这些碎片粘合在一起。MoM 将这种责任移到了一个模型边界之后,使智能分配成为模型的一部分,从而应用程序只需看到一个模型身份,而系统在内部进行工作路由、应用策略并协调模型。
MoM 的四个平面
一个完整的 MoM 跨越四个平面:构件 (artifact)、学习 (learning)、执行 (execution) 和物理实现 (physical realization)。
- Artifact 拥有组件、能力、目标、策略、评估契约、溯源;vLLM‑SR 中已有的基础包括规范配置、模型引用、DSL、版本化策略;下一步是可移植的 MoM 导入/导出规范。
- Learning 拥有路由器拥有的模型、偏好、结果、配方改进;基础包括训练栈、Router Learning、重放、结果 API;下一步是联合训练和系统级发布闸门。
- Execution 拥有信号、投影、决策、选择器、循环器、插件;基础包括 Signal–Decision 运行时、Fusion、ReMoM、工作流、安全和内存;下一步是一个生命周期感知的 MoM 引擎。
- Physical 拥有提供商、模型池、加速器、位置、缓存和能量状态;基础包括 vLLM 后端、云提供商、ROCm、CUDA、OpenVINO、CPU;下一步是跨云、数据中心、边缘和本地设备的便携式放置。
部署使用四个对象:bundle(固定接口、图、策略、行为变体、边界、不可变语义资产)、binding(将逻辑组件映射到合格的部署而不改变决策语义)、resolution lock(冻结组成部分版本、运行时、镜像、加速器、提供商观测结果)以及 run record(将每个决策、调用、约束检查、成本和结果归因于 bundle、binding 和 lock)。
vLLM‑SR 作为 MoM 引擎
训练、评估和推理必须共享一个契约;否则研究、基准测试和生产将会产生偏差。
训练是分配,而不仅仅是权重
MoM 训练涵盖了路由器拥有的嵌入 (embeddings)、信号编码器、偏好和安全模型以及选择器。它还学习分配和协作:哪条路径适合工作负载和预算、何时应该停止级联、面板应如何判断或合成,以及何时代理会话应该切换模型。进度可以通过追踪和结果进行优化,而不需要通过所有组成部分进行梯度计算。
将 MoM 作为一个模型进行评估
评估必须对模型身份进行端到端评分;后端基准测试是输入,而不是结果。一个版本化的计分卡应衡量路由遗憾 (routing regret)、协作增益、恢复能力、会话连续性、尾延迟、成本、安全性、隐私和能耗。它应该压力测试提供商故障、设备丢失、模型分歧、工作负载漂移和偏好变化。每个声明的运行点都需要自己的测试:flash 测试其延迟-质量前沿,light 测试其质量底线,ultra 测试其预算范围。
在推理时执行智能
在推理时,引擎决定单个模型是否足够。它可能会选择一个本地专家、保留一个热会话、通过置信度级联进行升级、需要检索或验证、运行一个 Fusion 面板,或执行一个受限的工作流。运行时拥有预算、拓扑、回退、追踪和响应契约;应用程序进行常规的模型调用。
一个可以移动的模型
目标是构建一个完整的 MoM,它可以作为一个统一的模型进行构建、导出、导入、版本化、评估、部署和调用。一个逻辑规范编译成一个不可变的 bundle,绑定到环境,解析具体的部署,并为服务和评估保留相同的身份。
构件应该在开发者机器、私有集群、云端集群和边缘环境中运行,而其物理实现可以发生变化。该项目已经支持跨 ROCm、CUDA、OpenVINO 和 CPU 的路径;硬件能力和放置将成为 MoM 契约的一部分。
用户体验标准很简单:
一个模型身份。多个模型。任何硬件。
现在有哪些变化
下一阶段侧重于四个相关的领域:
- 定义一个可移植的 MoM 规范,将组件、目标、策略、偏好、评估、约束和执行语义打包为一个版本化的构件。
- 通过从评估和重放中改进模型和配方,来闭合训练-评估-推理循环,然后通过可审查、可回滚的安全发布进行交付。
- 构建一个异构运行时,利用硬件、位置、能量和数据边界作为输入,将一个 MoM 映射到云、数据中心和边缘。
- 保持模型接口的“无聊”(简单化),使 MoM 的导入、部署和调用像单个模型一样简单。
与我们一起构建
构建混合模型需要模型训练、评估、服务系统、硬件和生产运营方面的协作。该项目在学习分配、偏好优化、模型协作、能效感知推理、可移植构件、开放评估和异构运行时方面寻求贡献。
如果你正在研究这些问题,我们希望从你的工作负载和测量中学习。构建一个运行点,添加一个运行时,测试一个协作配方,或者发布一个组合失败的案例。
致谢名单列出了帮助塑造该项目的贡献者和合作者,包括来自 MBZUAI、麦吉尔大学 (McGill University)、Mila、莱斯大学 (Rice University) 的工程师以及许多公司和开源社区。该项目已有 1,734 次提交和 150 多位贡献者。
在 GitHub 上加入我们,探索文档,在 Hugging Face 上尝试 MoM 模型家族,并在 vLLM Slack 的 #semantic-router 频道中与社区交流。
vLLM Semantic Router 起初是帮助基础设施为每个请求选择合适的模型。现在我们正在将该基础扩展到单一模型之外:迈向能够跨设备和环境协调、评估和运行多个模型的系统。
我们邀请社区在开放环境下帮助构建和测试这种方法。