vLLM Semantic Router v0.3 Themis 发布说明
vLLM Semantic Router v0.3 Themis 发布说明
vLLM Semantic Router v0.3 代号为 Themis,正在从一个可组合的工具转型为具有状态、可观测且面向生产的控制平面。本次发布专注于运营稳定性,提供统一的配置契约和一个将原始信号转化为模型选择决策的结构化流水线。
规范配置与运营契约
Themis 引入了规范的 config.yaml 结构,以消除不同部署环境(Docker、Helm、Dashboard 和 CRDs)之间重叠的布局。这种统一的契约确保了无论是在本地还是在 Kubernetes 中部署,策略都能保持一致。
关键配置变更包括:
- 统一结构: 配置现在遵循严格的结构:
version、listeners、providers、routing和global。 - 简化工作流: 移除了
vllm-sr init命令。用户现在可以使用vllm-sr serve进行以 Dashboard 为中心的设置,或直接编写config.yaml。 - 迁移路径: 旧配置可以使用
vllm-sr config migrate --config old-config.yaml进行更新。 - 严格验证: 系统现在会对未知的 YAML 字段发出警告,并将 Python CLI 模型与 Pydantic 对齐,以防止隐蔽的路由漂移。
路由流水线:信号、投影与决策
Themis 将路由思维模型形式化为五层流水线,以确保路由智能保持可编程性和可解释性。
| 层级 | 职责 |
|---|---|
| Signal | 从请求、响应、工具、模态、身份或安全分类器中提取证据。 |
| Projection | 将原始证据归一化为就绪的策略概念(例如“紧迫性”或“平衡性”)。 |
| Decision | 根据优先级和可解释的条件匹配命名的路由策略。 |
| Algorithm | 从匹配决策中的候选者中选择一个特定模型。 |
| Model | 通过选定的后端别名或提供者提供请求服务。 |
信号家族 (Signal Families)
路由器支持广泛的信号目录,包括 authz(角色)、complexity(推理难度)、context(上下文窗口需求)、conversation(工具循环形态)、domain(业务/法律/医疗)、embedding(语义相似度)、event(运营元数据)、fact_check(验证需求)、jailbreak(注入证据)、kb(知识库匹配)、keyword(字面/模糊匹配)、language(语言区域)、modality(AR/diffusion/text)、pii(敏感实体)、preference(用户风格)、reask(不满检测)、structure(正则/密度)以及 user_feedback(纠错请求)。
投影 (Projections)
投影将嘈杂的信号证据转化为稳定的策略区间。这避免了在多个决策中重复设置低级信号阈值的需要。Themis 支持三种投影模式:
- Partitions (分区): 从一个排他的家族中选择一个获胜者。
- Scores (评分): 将信号或 KB 指标组合成一个连续值。
- Mappings (映射): 通过校准的阈值将值转换为策略区间(例如
support_fast或support_escalated)。
会话感知智能体路由 (SAAR)
SAAR 为多轮智能体工作负载提供有状态的路由,确保会话连续性,并防止在活跃的工具循环期间发生不安全的模型切换。
SAAR 的核心能力包括:
- 会话记忆 (Session Memory): 由路由器拥有的记忆,无需单独的会话状态 DSL 即可保留事实和偏好。
- 连续性规则 (Continuity Rules): 通过权衡质量差距、切换边际和前缀局部性,评估模型切换是否合理。
- 硬锁定 (Hard Locks): 在活跃的工具循环或提供者状态延续期间防止模型切换,以保持稳定性。
- 诊断 (Diagnostics): 回放记录保留了会话为何留在当前模型或切换模型的具体推理过程。
协议兼容性与硬件支持
扩展的协议支持
Themis 的支持范围已从 OpenAI Chat Completions 扩展到包含原生的 Anthropic /v1/messages 入口、带有 OpenAI SSE 转换的流式传输,以及自定义的 Anthropic 上游路由。系统通过请求路径请求头进行协议检测,并提供响应头以指示转换是否存在损耗。
硬件后端路径
Themis 通过四条主要路径支持异构推理栈:
- NVIDIA CUDA & AMD ROCm: 用于提供服务的 vLLM 后端。AMD 路径通过
vllm-sr serve --platform amd进行验证。 - Intel OpenVINO: 用于 ModernBERT 序列分类和嵌入推理的原生 C++ 和 Go 集成的全新绑定。
- CPU/Local: 用于开发和冒烟测试。
可靠性、可观测性与性能
长上下文优化
为了降低长上下文路由的成本,Themis 引入了:
- 在线校准 (Online Calibration): 从观察到的响应使用情况中学习校准比例,以改进 Token 估计。
- 分块注意力 (Chunked Attention): 原生的 mmBERT embedding 路径现在在查询块中处理注意力,以限制内存并防止长输入的裁剪。
- 提示词压缩配置 (Prompt Compression Profiles): 命名的配置(
default、coding、medical、security、multi_turn)在不改变发送给服务模型的原始提示词的情况下优化信号提取。
存储与可观测性
本次发布通过支持 Qdrant 向量搜索和 Valkey(缓存、向量存储和内存)强化了存储层。它还将 O(N) 缓存-LRU 读取路径替换为常数时间列表支持的实现,并修复了用于路由器回放的 PostgreSQL 插入正确性问题。
基准测试
根据 RouterArena 排行榜 的快照,vLLM-SR 已重返第一名,加权 Arena 分数为 75.4,准确率为 76.0%,成本为 每 1K 次查询 $0.11。
未来路线图:v0.4 Hermes
即将发布的 Hermes 版本旨在创建一个“自我改进的路由器”。路线图重点在于闭合 GPU 级性能研究、DSL 配方微调和编码器模型微调之间的环路,同时进一步收紧 SAAR 的模型切换经济性,并通过 Dashboard 扩展操作员调试环路。