단일 모델을 넘어: vLLM Semantic Router로 Mixture-of-Models 시스템 구축하기
단일 모델을 넘어: vLLM Semantic Router로 Mixture-of-Models 시스템 구축하기
TL;DR
vLLM Semantic Router는 Mixture-of-Models (MoM) 시스템에 대한 지원을 추가하여, fragmented 모델, 컴퓨팅, 위치, 선호도 문제를 내부 모델 시스템으로 변환합니다. 이 시스템은 한 버전된 모델 정체성을 제시하면서 dietro 씬에서 독립 모델을 오케스트레이션합니다.
배경 및 동기
모델, 컴퓨팅, 위치, 사용자 선호도의 fragmentation은 각 애플리케이션이 이러한 차이를 자체적으로 조정하도록 강요합니다. 모델 경계를 지능적 할당을 포함하도록 이동하면 할당이 모델의 일부가 되어 fragmentation이 시스템 내부에 유지됩니다.
vLLM Semantic Router의 진화
2025년 4월의 인큐베이션부터 2026년 6월의 Themis 릴리스까지, vLLM‑SR은 간단한 intent‑aware 라우팅에서 프로젝션, 재생, 프로토콜 지원을 갖춘 상태ful, 세션‑aware 제어로 발전했습니다. Iris 릴리스는 composable 라우팅과 MoM 모델 패밀리를 도입했으며, Athena는 모델 선택, 메모리, RAG, 멀티모달리티, 그리고 운영 대시보드를 추가했습니다. Themis는 세션‑aware 에이전트 라우팅, 재생 가능한 트레이스, 그리고 크로스‑하드웨어 지원을 갖춘 operable 계약으로 시스템을 전환했습니다.
Mixture-of-Models란 무엇인가
Mixture-of-Models는 각 요청을 독립 모델과 연산자 간의 선호‑조건부, 리소스‑바운드 경로를 통해 실현하는 버전된 복합 모델이며, 하나의 모델 인터페이스를 통해 제시되고 하나의 귀속 가능한 결과를 반환합니다. Mixture‑of‑Experts와 달리, MoM은 아키텍처, 소유자, 라이선스, 모달리티, 프로토콜, 컨텍스트 윈도우, 하드웨어가 다를 수 있는 독립 모델을 조정하며, MoE 체크포인트는 MoM의 구성 요소가 될 수 있습니다.
| 측면 | 기존 모델 | Mixture-of-Models |
|---|---|---|
| 지능의 단위 | One checkpoint | A governed system of models |
| 전문화 | 주로 가중치에 인코딩 | 독립 전문가 간에 구성 |
| 실행 | One generation path | 선택, 캐스케이드, 검증, 융합, 또는 워크플로 |
| 최적화 대상 | One model의 품질과 효율성 | 품질, 비용, 지연, 안전, 프라이버시, 에너지 전반의 시스템 프론티어 |
| 배포 경계 | One runtime | 클라우드, 데이터 센터, 엣지 |
| 사용자 계약 | One model identity | One model identity |
모델 경계를 이동해야 하는 이유
모델, 컴퓨팅, 위치, 사용자 선호도는 각각 fragmentation되어 있으며, 단일 모델이 모든 차원에서 승리하는 경우는 없습니다. 오늘날 각 애플리케이션은 이러한 조각들을 붙여야 합니다. MoM은 해당 책임 하나를 모델 경계 뒤로 이동시켜 지능적 할당을 모델의 일부로 만들므로, 애플리케이션은 하나의 모델 정체성만 보게 되고 시스템은 내부적으로 작업을 라우팅하고 정책을 적용하며 모델을 조정합니다.
MoM의 네 가지 평면
완전한 MoM은 아티팩트, 학습, 실행, 물리적 실현이라는 네 가지 평면을 포괄합니다.
- 아티팩트는 컴포넌트, 기능, 목표, 정책, 평가 계약, 출처를 소유하며, vLLM‑SR의 기초에는 캐노니컬 설정, 모델 참조, DSL, 버전된 정책이 포함됩니다; 다음 단계는 휴대 가능한 MoM 가져오기/내보내기 사양입니다.
- 학습은 라우터 소유 모델, 선호도, 결과, 레시피 개선을 소유하며, 기초에는 트레이닝 스택, 라우터 학습, 재생, 결과 API가 포함됩니다; 다음 단계는 공동 학습 및 시스템 수준 출시 게이트입니다.
- 실행은 신호, 프로젝션, 결정, 셀렉터, 루퍼, 플러그인을 소유하며, 기초에는 Signal–Decision 런타임, 퓨전, ReMoM, 워크플로, 안전 및 메모리가 포함됩니다; 다음 단계는 라이프사이클‑aware MoM 엔진 하나입니다.
- 물리적은 제공자, 모델 풀, 가속기, 위치, 캐시 및 에너지 상태를 소유하며, 기초에는 vLLM 백엔드, 클라우드 제공자, ROCm, CUDA, OpenVINO, CPU가 포함됩니다; 다음 단계는 클라우드, 데이터 센터, 엣지, 로컬 디바이스 전반에 걸친 휴대 가능한 배치입니다.
배포는 네 가지 객체를 사용합니다: 번들 (인터페이스, 그래프, 정책, 행동 변형, 경계, 불변 시맨틱 자산을 고정), 바인딩 (결정 시맨틱을 변경하지 않고 논리적 구성 요소를 적격 배포에 매핑), 해상도 락 (구성 요소 리비전, 런타임, 이미지, 가속기, 제공자 관찰을 동결), 그리고 실행 기록 (번들, 바인딩, 락에 모든 결정, 호출, 제약 검사, 비용, 결과를 속성).
vLLM‑SR로서의 MoM 엔진
훈련, 평가, 추론은 하나의 계약을 공유해야 하며, 그렇지 않으면 연구, 벤치마크, 프로덕션이 drift됩니다.
훈련: 할당만, 가중치가 아님
MoM 훈련은 라우터 소유 임베딩, 신호 인코더, 선호 및 안전 모델, 셀렉터를 다룹니다. 또한 할당과 협업을 학습합니다: 어떤 경로가 워크로드와 예산에 맞는지, 캐스케이드가 언제 멈춰야 하는지, 패널이 어떻게 판단하거나 합성해야 하는지, 그리고 에이전트 세션이 언제 모델을 전환해야 하는지. 모든 구성 요소를 통해 그래디언트를 요구하지 않고 트레이스와 결과로부터 진행 상황을 최적화할 수 있습니다.
MoM을 하나의 모델로서 평가
평가는 모델 정체성을 엔드‑투‑엔드로 점수해야 하며, 백엔드 벤치마크는 입력이지 결과가 아닙니다. 버전된 스코어카드는 라우팅 후회, 협업 이득, 복구, 세션 연속성, 꼬리 지연, 비용, 안전, 프라이버시, 에너지를 측정해야 합니다. 제공자 장애, 장치 손실, 모델 불일치, 워크로드 드리프트, 선호도 변화에 대한 스트레스 테스트를 수행해야 합니다. 각 선언된 운영 지점은 자체 테스트가 필요합니다: flash는 latency–quality 프론티어에서, light는 quality floor에 대해, ultra는 예산 내에서 수행해야 합니다.
추론 시 지능 실행
추론 시 엔진은 하나의 모델이 충분한지 결정합니다. 로컬 전문가를 선택하거나, 따뜻한 세션을 유지하거나, 신뢰도 캐스케이드를 통해 escalate하거나, 검색 또는 검증을 요구하거나, Fusion 패널을 실행하거나, 제한된 워크플로우를 실행할 수 있습니다. 런타임은 예산, 토폴로지, 폴백, 트레이스, 응답 계약을 소유하며, 애플리케이션은 일반적인 모델 호출을 수행합니다.
이동할 수 있는 하나의 모델
목표는 빌드, 내보내기, 가져오기, 버전 관리, 평가, 배포, 호출이 가능한 완전한 MoM을 통합 모델로서 달성하는 것입니다. 논리 사양은 불변 번들로 컴파일되고, 환경에 바인딩되며, 구체적인 배포를 해결하고, 제공 및 평가 시 동일한 정체성을 유지합니다.
아티팩트는 개발자 머신, 프라이빗 클러스터, 클라우드 플릿, 엣지 환경에서 실행되어야 하며, 그 물리적 실현은 변경될 수 있습니다. 프로젝트는 이미 ROCm, CUDA, OpenVINO, CPU 전반의 경로를 지원하며, 하드웨어 능력과 배치는 MoM 계약의 일부가 될 것입니다.
사용자 경험 표준은 간단합니다:
One model identity. Many models. Any hardware.
현재 변경 사항
다음 단계는 네 가지 연결된 영역에 초점을 맞춥니다:
- 컴포넌트, 목표, 정책, 선호도, 평가, 제약, 실행 시맨틱을 하나의 버전된 아티팩트로 패키징하는 휴대 가능한 MoM 사양을 정의합니다.
- 평가와 재생으로부터 모델과 레시피를 개선하여 검토 가능하고 롤백 안전한 릴리스를 통해 배송함으로써 훈련–평가–추론 루프를 닫습니다.
- 하드웨어, 위치, 에너지, 데이터 경계를 입력으로 사용하여 클라우드, 데이터 센터, 엣지 전반에 하나의 MoM을 매핑하는 이질적 런타임을 구축합니다.
- 모델 인터페이스를 지루하게 유지하여 MoM이 단일 모델만큼 쉽게 가져오고, 배포하고, 호출할 수 있도록 합니다.
우리와 함께 구축하기
Mixture‑of‑Models 구축은 모델 훈련, 평가, 서빙 시스템, 하드웨어, 프로덕션 운영에서의 작업이 필요합니다. 프로젝트는 학습된 할당, 선호도 최적화, 모델 협업, 에너지‑aware 추론, 휴대 가능한 아티팩트, 오픈 평가, 이질적 런타임에서의 기여를 찾습니다.
이러한 문제를 다루고 있다면, 우리는 귀하의 워크로드와 측정으로부터 배우고 싶습니다. 운영 지점을 구축하거나, 런타임을 추가하거나, 협업 레시피를 테스트하거나, 구성 실패 사례를 발표할 수 있습니다.
감사 목록에는 MBZUAI, McGill 대학교, Mila, Rice 대학교의 엔지니어 및 많은 기업과 오픈소스 커뮤니티의 기여자와 협력자가 포함되어 있습니다. 프로젝트는 현재 1,734개의 커밋과 150명 이상의 기여자를 보유하고 있습니다.
GitHub에서 저희와 함께 하세요, 문서를 탐색하고, Hugging Face에서 MoM 모델 패밀리를 시도하며, vLLM Slack의 #semantic‑router 채널에서 커뮤니티를 만나세요.
vLLM Semantic Router는 인프라가 각 요청에 적합한 모델을 선택하도록 돕기 시작했습니다. 이제 우리는 단일 모델을 넘어 해당 기반을 확장하여, 디바이스와 환경 전반에 걸쳐 여러 모델을 조정, 평가, 운영할 수 있는 시스템을 향해 나아가고 있습니다.
우리는 커뮤니티가 이 접근 방식을 공개적으로 구축하고 테스트하는 데 도움을 주기를 초대합니다.