vLLM Semantic Router: 마이크로 에이전트 협업을 통한 모델 성능 향상
vLLM Semantic Router: 마이크로 에이전트 협업을 통한 모델 성능 향상
vLLM은 Semantic Router를 도입했는데, 이는 서빙 레이어 프리미티브로서 단일 모델 API 호출을 통해 여러 모델의 제한된 협업을 트리거할 수 있게 하며, 이를 통해 모델 팀을 단일 모델 정체성으로 효과적으로 취급합니다. 이 접근 방식은 애플리케이션 레이어가 복잡한 에이전트 그래프를 관리할 필요 없이 작업별 협업 '레시피'를 선택함으로써 프론티어 모델의 성능에匹敵하거나 이를 초과할 수 있게 합니다.
Semantic Router를 기능 레이어로
백엔드로의 수동 패스스루 역할을 하는 대신, vLLM Semantic Router는 능동적 제어 평면으로 작동합니다. 이는 비용 절감, 안전 정책 시행, 클라우드-에지 조정에 초점을 맞추었던 전통적인 라우터의 역할을 기능 구축을 위한 도구로 변환합니다.
안정된 모델 정체성(예: vllm-sr/auto)을 사용함으로써, 라우터는 작업자에게 팬아웃, 쿼럼 수집, 불일치 검증, 최종 답변 합성과 같은 복잡한 내부 프로세스를 실행하면서 사용자에게 표준 OpenAI 호환 응답을 반환할 수 있습니다.これにより, 다중 모델 협업의 복잡성이 애플리케이션에서 서빙 인프라로 추상화됩니다.
Looper: 마이크로 에이전트를 위한 실행 런타임
Semantic Router의 핵심은 'looper'이며, 이는 제한된 마이크로 에이전트를 관리하는 런타임입니다. 라우터에 요청이 들어오면, 적절한 looper 알고리즘을 결정하기 위해 task-shape 또는 risk 밴드로 투영됩니다. 주요 looper 패턴은 다음과 같습니다:
- Confidence: 비용 인식 순차적 에스컬레이션 루프. 먼저 더 저렴한 모델을 시도하고, 신뢰도 점수(로그 확률, 자체 검증, 또는 entailment 검증에서 유도됨)가 특정 임계값 이하로 떨어질 경우에만 더 비싼 후보로 에스컬레이션합니다.
- Ratings:
max_concurrent상한 내에서 여러 후보를 병렬로 실행하는 통제된 앙상블 루프. rating-aware 가중치를 사용하여 결과를 집계합니다. - ReMoM (Repeated Mixture-of-Model): reasoning-집중 루프. 여러 시도를 팬아웃하고, 최소 성공 쿼럼을 기다린 후, 합성 모델을 사용하여 증거를 최종 출력 계약으로 병합합니다.
- Fusion: 불일치를 신호로 취급하는 패턴. 독립적인 패널 답변이 판정자와 최종자에게 제공되며, 이들은 모순과 독특한 통찰을 분석하여 최종 응답을 생성합니다.
- Workflows: 정적 역할 또는 동적 플래너를 지원하는 bounded 에이전틱 런타임. 단계, 병렬ism, 타임아웃에 대한 엄격한 제한 내에서 작업자 단계를 실행하여 시스템이 무한 자율 에이전트가 되는 대신 인프라에 의해 관리되도록 보장합니다.
최적화된 성능을 위한 작업 형태 레시피
작업의 특정 요구사항과 협업 패턴을 매칭함으로써 성능 향상이 달성됩니다. vLLM은 최적의 루프가 '작업 형태'라고 주장하며, 이는 서로 다른 벤치마크가 서로 다른 레시피가 필요함을 의미합니다:
- GPQA-Diamond:
ANSWER: X형식의 엄격한 보존을 갖는 ReMoM 레시피를 사용하여 어려운 과학 다중 선택 질문에 적용합니다. - LiveCodeBench: 제약 조건, 스타터 코드, 숨은 테스트 위험을 평가하는 코드 형태 루프를 사용합니다.
- Humanity's Last Exam (HLE): 형식적 추론과 불일치 위험에 기반하여 더 깊은 ReMoM, 더 작은 Fusion, 또는 폴백 경로 중에서 선택합니다.
벤치마크 성능
평가 결과, 라우터 소유 협업은 개별 모델 호출보다 더 강한 모델 정체성을 만들 수 있음을 보여줍니다. 다음 결과는 VSR Closed(폐쇄형 모델 백엔드만 사용)와 VSR Hybrid(개방형 및 폐쇄형 모델 혼합)를 비교합니다:
| Benchmark | VSR Row | Score | Reference Baselines |
|---|---|---|---|
| LiveCodeBench (Jan-Apr 2025) | VSR Closed | 92.6 | Fugu Ultra (92.0), GPT-5.5 (90.7), Opus 4.8 (90.3) |
| GPQA-Diamond | VSR Closed | 96.0 | Fugu Ultra (95.5), Gemini 3.1 Pro (94.3), GPT-5.5 (93.6) |
| Humanity's Last Exam | VSR Closed | 50.0 | Fugu Ultra (50.0), Gemini 3.1 Pro (45.0) |
| Humanity's Last Exam | VSR Hybrid | 47.1 | Qwen3.7 Max (41.4), GPT-5.5 (41.4) |
모델 서빙 인프라에 대한 함의
이 변화는 모델 서빙을 수동 스택에서 능동적인 것으로 이동시킵니다. 라우터는 이제 마이크로 에이전트 오케스트레이션의 필수 구성 요소를 관리합니다: 모델 별칭, 제공자 정책, 자격 증명, 비용 메타데이터, 응답 의미론. 이러한 기능을 서빙 레이어에 통합함으로써, vLLM은 클라이언트 측 통합을 변경하지 않고도 시스템의 추론 능력과 효율성을 향상시킬 수 있습니다.