vLLM Semantic Router v0.2 Athena 릴리스 노트 / 새로운 내용
vLLM Semantic Router v0.2 Athena는 의미 기반 라우팅을 단순 요청 브리지에서 모델 혼합 및 다중 에이전트 배포를 위한 전략적 "시스템 뇌"로 변환합니다. 이번 릴리스에서는 완전히 재구성된 모델 기반, OpenClaw 시스템을 오케스트레이션하기 위한 실험적 ClawOS 운영 레이어, 그리고 동적이며 비용·품질을 인식하는 라우팅을 가능하게 하는 정교한 모델 선택 프레임워크를 도입했습니다.
재구성된 모델 기반 및 런타임 가속
Athena는 파편화된 베이스 모델 아키텍처를 통합된 장기 컨텍스트 다국어 기반으로 교체했습니다. 시스템은 이제 mmbert-embed-32k-2d-matryoshka(307M 파라미터, 32K 컨텍스트, 1800개 이상의 언어 지원)와 mom-multilingual-class 분류기 패밀리를 중심으로 동작합니다.
핵심 모델 구성 요소
multi-modal-embed-small: 약 120M 파라미터를 가진 임베딩 모델로 텍스트, 이미지, 오디오를 384차원 공유 공간에 매핑하여 교차 모달 검색을 가능하게 하며, Audio-Text Retrieval R@1 36.4%를 기록했습니다.mmbert-embed-32k-2d-matryoshka: 32K 컨텍스트와 2D Matryoshka 제어를 제공하는 프로덕션 준비 백본으로, 768d에서 256d로 절단해도 약 99% 품질을 유지합니다.mom-multilingual-class: Intent, Jailbreak, PII, Fact-check, Feedback 다섯 가지 핵심 작업을 포괄하는 일관된 분류기 패밀리이며, 병합 형태와 LoRA 형태 모두 제공됩니다.
하드웨어 가속 및 성능
Athena는 모델 인식 ONNX 재작성과 onnx-binding/ort-ck-flash-attn을 통한 맞춤형 ROCm 커널 경로를 구현했습니다. 밀집 SDPA 어텐션 서브그래프를 com.ck::CKFlashAttention 노드로 교체함으로써 AMD Instinct MI300X 하드웨어에서 지연 시간이 크게 감소합니다.
지연 시간 비교 (ONNX + GPU vs. CPU):
| 요청 크기 | ONNX + GPU 평균 | ONNX + CPU 평균 | Candle + CPU 평균 |
|---|---|---|---|
| ~500 토큰 | 22 ms | 853 ms | 1053 ms |
| ~2000 토큰 | 31 ms | 1814 ms | 1805 ms |
| ~8000 토큰 | 128 ms | 4796 ms | 1830 ms |
Flash Attention 스케일링: CK Flash Attention은 시스템이 최대 32K 토큰까지 처리하도록 하며, 이전 SDPA 경로에서는 메모리 부족(OOM) 오류가 발생했습니다. 4096 토큰에서는 CK Flash Attention이 SDPA보다 3.3배 빠릅니다.
고급 모델 선택 프리미티브
모델 선택은 이제 의사결정 매치가 이루어진 후에 수행되는 일급 라우팅 프리미티브입니다. Athena는 다양한 전략 알고리즘을 기반으로 요청을 처리할 특정 모델을 선택할 수 있게 합니다:
- ML 기반 선택기: KNN(과거 질의 유사도), KMeans(클러스터 수준 패턴), SVM(비선형 결정 경계), MLP(Candle 기반 신경 라우터) 포함.
- 고급 전략: Latency-Aware(TPOT/TTFT 데이터), Elo(사용자 피드백/Bradley‑Terry 평점), RouterDC(이중 대비 유사도), AutoMix(비용‑품질 상승), Thompson Sampling(온라인 탐색/활용) 포함.
- 추론 기반: Router‑R1은 선택 전에 외부 라우터 모델을 사용해 요청을 추론합니다.
ClawOS: OpenClaw 오케스트레이션
ClawOS는 Semantic Router가 다수의 OpenClaw 에이전트 시스템을 오케스트레이션할 수 있게 하는 실험적 운영 레이어입니다. 라우터의 역할을 모델 선택에서 다중 에이전트 환경 관리로 전환합니다. 주요 기능은 다음과 같습니다:
- 자연어 MCP 제어: 사용자는 채팅을 통해 OpenClaw 팀 및 워커를 생성·관리할 수 있습니다.
- 팀 관리: 명시적인 리더‑워커 구성과 실시간 협업을 위한 공유 방 채팅을 지원합니다.
- 운영 가시성: 런타임 상태, 팀 구성, 워커 프로비저닝을 보여주는 대시보드 뷰를 제공합니다.
핵심 런타임 개선: 메모리, RAG, 신호
상태와 메모리
Athena는 상태를 핵심 런타임에 직접 통합하여 Milvus 스토리지를 이용한 에이전시 메모리, 벡터 유사도·BM25·n‑gram 매칭을 결합한 하이브리드 메모리 검색, 그리고 메모리 주입 공격을 완화하는 MINJA 방어 기능을 추가했습니다.
확장된 신호 레이어
신호 레이어는 이제 더 다양한 입력 및 매칭 경로를 지원합니다:
- 풍부한 신호: 언어, 지연, 컨텍스트, 복잡도 인식, 모달리티, 권한(authz) 신호 추가.
- 결정적 빠른 경로: BM25, n‑gram 퍼지 매칭, 정규표현식 추가로 키워드 라우팅이 정확한 리터럴 매칭을 넘어선 보다 견고한 경로가 됩니다.
- 안전 통합: Jailbreak 및 PII 탐지가 병렬 신호로 포함되며, 점진적 상승 공격을 포착하기 위한 대비 다중 턴 탐지도 포함됩니다.
NLP 기반 프롬프트 압축
긴 컨텍스트 신호 추출을 최적화하기 위해 Athena는 TextRank, 위치 가중치, TF‑IDF, 신규성 점수를 활용한 결정적 NLP 파이프라인을 도입했습니다. 이 파이프라인은 신호 추출 경로에만 긴 프롬프트를 압축하고, 원본 전체 프롬프트는 서빙 모델에 그대로 전달합니다. 벤치마크에서 16K 토큰을 512 토큰으로 압축했을 때 jailbreak 신호 추출 지연을 127 ms에서 10 ms로 감소시켰습니다.
프로그래머블 설정 및 배포
신경‑기호 설정 언어
Athena는 신경 신호 추출과 기호적 의사결정 평가를 결합한 타입이 지정된 설정 언어를 도입했습니다. 이 DSL은 전체 컴파일러와 시각적 빌더를 지원해 LLM 기반 코딩 에이전트가 자연어 사양으로부터 라우팅 정책을 합성할 수 있게 합니다.
AMD ROCm 일급 지원
AMD ROCm은 이제 표준 배포 경로가 되었습니다. vllm-sr serve --platform amd 명령은 ROCm 이미지 기본값, GPU 우선 설정, AMD CK Flash Attention 커스텀 연산 로드를 활성화합니다.
제로‑컨피그 온보딩
macOS와 Linux용 한 줄 설치 프로그램을 통해 설치가 간소화되었습니다. YAML‑우선 흐름에서 대시보드‑우선 온보딩 흐름으로 전환되어 사용자는 최소 작업공간을 자동으로 부트스트랩할 수 있습니다.