vLLM Semantic Router v0.2 Athena リリースノート / 新機能

vLLM Semantic Router v0.2 Athena は、シンプルなリクエストブリッジから、モデル混合やマルチエージェント展開向けの戦略的な「システムブレイン」へとセマンティックルーティングを変換します。このリリースでは、完全に作り直されたモデル基盤、OpenClaw システムをオーケストレーションする実験的な ClawOS オペレーティングレイヤー、そして動的でコスト・品質を考慮したルーティングを可能にする高度なモデル選択フレームワークを導入します。

作り直されたモデル基盤とランタイムアクセラレーション

Athena は、断片的だったベースモデルアーキテクチャを統一された長コンテキスト多言語基盤に置き換えました。システムは現在、mmbert-embed-32k-2d-matryoshka(307M パラメータ、32K コンテキスト、1800 以上の言語に対応)と mom-multilingual-class 分類器ファミリーを中心に構成されています。

主なモデルコンポーネント

  • multi-modal-embed-small: 約 120M パラメータの埋め込みモデルで、テキスト・画像・音声を 384 次元の共有空間にマッピングし、Audio-Text Retrieval R@1 が 36.4% と報告されています。
  • mmbert-embed-32k-2d-matryoshka: 32K コンテキストと 2D マトリョーシカ制御を備えた本番向けバックボーンで、768 次元から 256 次元への切り詰めでも品質を約 99% 保持します。
  • mom-multilingual-class: Intent、Jailbreak、PII、Fact-check、Feedback の 5 つのコアタスクをカバーする一貫した分類器ファミリーで、マージド形式と LoRA 形式の両方が利用可能です。

ハードウェアアクセラレーションとパフォーマンス

Athena はモデル認識型 ONNX リライトと onnx-binding/ort-ck-flash-attn を介したカスタム ROCm カーネルパスを実装しています。密な SDPA アテンションサブグラフを com.ck::CKFlashAttention ノードに置き換えることで、AMD Instinct MI300X ハードウェア上で大幅なレイテンシ削減を実現しています。

レイテンシ比較(ONNX + GPU vs. CPU):

リクエストサイズ ONNX + GPU 平均 ONNX + CPU 平均 Candle + CPU 平均
約 500 トークン 22 ms 853 ms 1053 ms
約 2000 トークン 31 ms 1814 ms 1805 ms
約 8000 トークン 128 ms 4796 ms 1830 ms

Flash Attention スケーリング: CK Flash Attention により、システムは最大 32K トークンまでのシーケンス長を処理可能です。従来の SDPA パスでは OOM エラーが発生していましたが、4096 トークンでは CK Flash Attention が SDPA の 3.3 倍の速度を示します。

高度なモデル選択プリミティブ

モデル選択は、決定マッチが行われた後に実行される第一級のルーティングプリミティブとなりました。Athena は、さまざまな戦略アルゴリズムに基づいてリクエストに最適なモデルを選択できます。

  • ML ベースのセレクタ: KNN(過去クエリ類似度)、KMeans(クラスタレベルパターン)、SVM(非線形決定境界)、MLP(Candle を用いたニューラルルータ)を含みます。
  • 高度な戦略: Latency-Aware(TPOT/TTFT データ)、Elo(ユーザーフィードバック/Bradley‑Terry 評価)、RouterDC(デュアルコントラスト類似度)、AutoMix(コスト対品質エスカレーション)、Thompson Sampling(オンライン探索/活用)を含みます。
  • 推論ベース: Router‑R1 は外部ルータモデルを使用してリクエストを推論し、選択前に評価します。

ClawOS: OpenClaw のオーケストレーション

ClawOS は、Semantic Router が複数の OpenClaw エージェントシステムをオーケストレーションできるようにする実験的なオペレーティングレイヤーです。ルータの役割を「モデル選択」から「マルチエージェント環境の管理」へとシフトさせます。主な機能は次のとおりです。

  • 自然言語 MCP コントロール: ユーザーはチャットを通じて OpenClaw チームやワーカーを起動・管理できます。
  • チーム管理: リーダー‑ワーカー構成の明示的なサポートと、リアルタイム協調のための共有ルームチャットを提供します。
  • 運用可視性: ランタイムのヘルス、チーム構成、ワーカープロビジョニングを示すダッシュボードビューがあります。

コアランタイム強化: メモリ、RAG、シグナル

状態とメモリ

Athena は状態をコアランタイムに直接統合し、Milvus ストレージを用いたエージェントメモリ、ベクトル類似度・BM25・n‑gram マッチングを組み合わせたハイブリッドメモリ検索、そしてメモリインジェクション攻撃を緩和する MINJA ディフェンスを追加しました。

拡張シグナル層

シグナル層は、より広範な入力とマッチングパスをサポートします。

  • リッチシグナル: 言語、レイテンシ、コンテキスト、複雑度、モダリティ、認可シグナルを追加。
  • 決定的高速パス: キーワードルーティングは BM25、n‑gram ファジーマッチ、正規表現の追加により、文字列リテラル一致だけに依存しなくなりました。
  • 安全性統合: Jailbreak と PII 検出が並列シグナルとなり、段階的エスカレーション攻撃を検出するコントラスト的マルチターン検出を含みます。

NLP ベースのプロンプト圧縮

長コンテキストシグナル抽出を最適化するため、Athena は決定的な NLP パイプライン(TextRank、位置重み付け、TF‑IDF、ノベルティスコア)を導入しました。これにより、シグナル抽出パス用に長いプロンプトを圧縮しつつ、元のフルフィデリティプロンプトはそのままモデルに送信します。ベンチマークでは、16K トークンを 512 トークンに圧縮した際、jailbreak シグナル抽出レイテンシが 127 ms から 10 ms に短縮されました。

プログラム可能な構成とデプロイ

ニューラル‑シンボリック構成言語

Athena は、ニューラルシグナル抽出とシンボリック意思決定評価を組み合わせた型付き構成言語を導入しました。この DSL はフルコンパイラとビジュアルビルダーでサポートされ、LLM ベースのコーディングエージェントが自然言語仕様からルーティングポリシーを合成できるようになります。

AMD ROCm 第一級サポート

AMD ROCm は標準的なデプロイパスとなりました。vllm-sr serve --platform amd コマンドで ROCm イメージのデフォルト設定、GPU 優先構成、AMD CK Flash Attention カスタム Op のロードが可能です。

ゼロコンフィグオンボーディング

macOS と Linux 用のワンラインインストーラによりインストールが簡素化され、YAML ファーストからダッシュボードファーストのオンボーディングフローへ移行しました。ユーザーは最小限のワークスペースを自動的にブートストラップできます。

Sources