vllm-project/vllm-omni

A framework for efficient model inference with omni-modality models

What it solves

vLLM-Omni는 기존 vLLM 프레임워크를 확장하여 omni-modality 모델의 서빙을 지원합니다. vLLM이 주로 텍스트 기반의 자기회귀(autoregressive) 생성에 설계된 반면, vLLM-Omni는 텍스트, 이미지, 오디오, 비디오 및 로봇 동작(robot actions)을 처리하고 생성하는 모델의 효율적인 추론 및 서빙을 가능하게 합니다.

How it works

이 프레임워크는 "OmniConnector"와 모델 파이프라인의 다양한 단계에 걸친 동적 리소스 할당을 기반으로 하는 완전 분리형(fully disaggregated) 아키텍처를 사용합니다. vLLM의 효율적인 KV cache 관리 기능을 자기회귀 작업에 활용하며, 처리량을 높이기 위해 파이프라인 단계 실행 중첩(pipelined stage execution overlapping)을 도입합니다. 또한 자기회귀 모델을 넘어 Diffusion Transformers (DiT) 및 기타 병렬 생성 모델에 대한 지원을 확장하여, 이종(heterogeneous) 출력(예: 텍스트와 이미지 생성 결합)을 가능하게 합니다.

Who it’s for

TTS, 이미지/비디오 생성, 로봇 정책(robot-policy) 모델을 포함하여 멀티모달 모델을 위한 고성능, 프로덕션급 서빙 스택을 배포해야 하는 개발자와 연구자들을 위한 것입니다.

Highlights

  • Broad Modality Support: 텍스트, 이미지, 오디오, 비디오 및 동작 데이터를 처리합니다.
  • Hardware Agnostic: CUDA, ROCm, MUSA, NPU, XPU 백엔드를 지원합니다.
  • Model Compatibility: Qwen3-Omni, Cosmos3, FLUX와 같은 인기 있는 Hugging Face 모델과 통합됩니다.
  • Distributed Inference: tensor, pipeline, data, expert parallelism을 지원합니다.
  • Production Ready: OpenAI 호환 API 서버와 스트리밍 출력을 제공합니다.