vLLM Semantic Router v0.2 Athena 发布说明 / 新功能
vLLM Semantic Router v0.2 Athena 将语义路由从简单的请求桥梁转变为面向混合模型和多代理部署的战略“系统大脑”。此版本引入了全新构建的模型基础、用于编排 OpenClaw 系统的实验性 ClawOS 操作层,以及一个复杂的模型选择框架,支持动态、成本感知和质量感知的路由。
重建的模型基础与运行时加速
Athena 用统一的长上下文多语言基础取代了碎片化的基础模型架构。系统现在围绕 mmbert-embed-32k-2d-matryoshka(307M 参数,32K 上下文,支持 1800+ 语言)和 mom-multilingual-class 分类器系列展开。
关键模型组件
multi-modal-embed-small:约 120M 参数的嵌入模型,将文本、图像和音频映射到共享的 384 维空间,实现跨模态检索,报告的音频-文本检索 R@1 为 36.4%。mmbert-embed-32k-2d-matryoshka:提供具备 32K 上下文和 2D Matryoshka 控制的生产就绪骨干网,可将维度从 768d 截断至 256d,质量保留约 99%。mom-multilingual-class:覆盖意图、越狱、PII、事实检查和反馈五大核心任务的统一分类器系列,提供合并版和 LoRA 版。
硬件加速与性能
Athena 实现了模型感知的 ONNX 重写以及通过 onnx-binding/ort-ck-flash-attn 的自定义 ROCm 内核路径。通过将密集的 SDPA 注意力子图替换为 com.ck::CKFlashAttention 节点,系统在 AMD Instinct MI300X 硬件上实现了显著的延迟降低。
延迟比较(ONNX + GPU vs. CPU):
| 请求大小 | ONNX + GPU 平均 | ONNX + CPU 平均 | Candle + CPU 平均 |
|---|---|---|---|
| ~500 tokens | 22 ms | 853 ms | 1053 ms |
| ~2000 tokens | 31 ms | 1814 ms | 1805 ms |
| ~8000 tokens | 128 ms | 4796 ms | 1830 ms |
Flash Attention 扩展: CK Flash Attention 使系统能够处理高达 32K 令牌的序列长度,而之前的 SDPA 路径会导致 OOM 错误。在 4096 令牌时,CK Flash Attention 比 SDPA 快 3.3 倍。
高级模型选择原语
模型选择现在是一等路由原语,在决策匹配完成后进行。Athena 允许系统根据多种策略算法选择为请求提供服务的具体模型:
- 基于机器学习的选择器:包括 KNN(历史查询相似度)、KMeans(聚类层次模式)、SVM(非线性决策边界)和 MLP(通过 Candle 的神经路由器)。
- 高级策略:包括 延迟感知(TPOT/TTFT 数据)、Elo(用户反馈/Bradley‑Terry 评分)、RouterDC(双对比相似度)、AutoMix(成本到质量的递增)和 Thompson 采样(在线探索/利用)。
- 基于推理的:Router‑R1 使用外部路由模型在选择前对请求进行推理。
ClawOS:OpenClaw 编排层
ClawOS 是一个实验性的操作层,使 Semantic Router 能够编排多个 OpenClaw 代理系统。它将路由器的角色从选择模型转变为管理多代理环境。关键功能包括:
- 自然语言 MCP 控制:用户可以通过聊天启动和管理 OpenClaw 团队及工作者。
- 团队管理:支持明确的领袖与工作者组合以及共享房间聊天,实现实时协作。
- 运营可视化:仪表盘视图展示运行时健康、团队构成和工作者配置。
核心运行时增强:内存、RAG 与信号
状态与内存
Athena 将状态直接集成到核心运行时,新增了使用 Milvus 存储的 Agentic Memory、混合记忆搜索(结合向量相似度、BM25 与 n‑gram 匹配)以及 MINJA 防御,以减轻记忆注入攻击。
扩展的信号层
信号层现在支持更广泛的输入和匹配路径:
- 丰富信号:新增语言、延迟、上下文、复杂度感知、模态和授权(authz)信号。
- 确定性快速路径:通过加入 BM25、n‑gram 模糊匹配和正则表达式,使关键字路由不再脆弱,超越了仅精确字面匹配。
- 安全集成:Jailbreak 和 PII 检测现在为并行信号,包含对比式多轮检测以捕获逐步升级的攻击。
基于 NLP 的提示压缩
为优化长上下文信号提取,Athena 引入了确定性的 NLP 流水线(使用 TextRank、位置加权、TF‑IDF 与新颖度评分)。该流水线仅压缩用于信号提取路径的长提示,而原始完整提示仍发送给服务模型。基准测试显示,在将 16K 令牌压缩至 512 令牌时,Jailbreak 信号提取延迟从 127 ms 降至 10 ms。
可编程配置与部署
神经‑符号配置语言
Athena 引入了一种带类型的配置语言,结合神经信号提取与符号决策评估。该 DSL 配备完整的编译器和可视化构建器,使基于 LLM 的编码代理能够从自然语言规范中合成路由策略。
AMD ROCm 一等支持
AMD ROCm 现已成为标准部署路径。vllm-sr serve --platform amd 命令启用 ROCm 镜像默认设置、GPU 优先配置以及加载 AMD CK Flash Attention 自定义算子。
零配置入门
通过 macOS 与 Linux 的一行安装脚本简化安装流程,将体验从 YAML 优先转变为仪表盘优先的入门流程,用户可自动引导最小工作空间。