vllm-project/vllm-omni

A framework for efficient model inference with omni-modality models

무엇을 해결하는가

vLLM-Omni는 기존 vLLM 프레임워크를 확장하여 "any-to-any" 멀티모달 모델 서빙을 지원합니다. vLLM은 주로 텍스트 기반의 자기회귀(autoregressive) 생성에 설계되었지만, vLLM-Omni는 텍스트, 이미지, 오디오, 비디오, 로봇 동작을 처리하고 생성하는 모델의 서빙을 가능하게 하며, 자기회귀 및 비자기회귀(예: Diffusion Transformers) 아키텍처를 모두 지원합니다.

어떻게 작동하는가

이 프레임워크는 OmniConnector와 다양한 단계에 걸친 동적 리소스 할당을 기반으로 하는 완전 분리형(fully disaggregated) 서빙 아키텍처를 사용합니다. vLLM의 효율적인 KV 캐시 관리 기능을 자기회귀 작업에 활용하고, 처리 과정을 중첩시켜 처리량을 높이기 위해 파이프라인 단계 실행을 구현합니다. 또한 텐서, 파이프라인, 데이터 및 전문가 병렬성(expert parallelism)을 통한 분산 추론을 지원합니다.

누구를 위한 것인가

OpenAI 호환 API 서버를 사용하여 TTS, 이미지/비디오/오디오 생성용 확산 모델(diffusion models), 로봇 정책 모델을 포함한 고성능 멀티모달 모델을 배포하고 서빙해야 하는 개발자와 연구자들을 위한 것입니다.

주요 특징

  • 광범위한 모달리티 지원: 텍스트, 이미지, 오디오, 비디오 및 동작 데이터를 처리합니다.
  • 이종 아키텍처 지원: 자기회귀 모델과 Diffusion Transformers (DiT)를 모두 지원합니다.
  • 실시간 기능: 스트리밍 오디오 입출력을 통한 전이중(full-duplex) 실시간 서빙을 제공합니다.
  • 폭넓은 하드웨어 호환성: CUDA, ROCm, XPU, NPU, MUSA를 지원합니다.
  • 모델 통합: Qwen3-Omni, MiniMax H3 및 다양한 로봇 정책 모델과 같은 인기 있는 Hugging Face 모델과 원활하게 통합됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트