MiniMax M3 vLLM 지원: 1M-토큰 멀티모달 추론을 위한 Day-0 서빙
MiniMax M3 vLLM 지원: 1M-토큰 멀티모달 추론을 위한 Day-0 서빙
vLLM은 BF16 및 MXFP8 체크포인트를 포함한 MiniMax M3 모델 패밀리에 대한 day-0 지원을 발표했습니다. 이번 릴리스는 백만 토큰 컨텍스트, 네이티브 멀티모달 추론, 그리고 도구 사용 및 제어 가능한 사고 행동을 갖춘 에이전시 워크플로우가 필요한 워크로드의 서빙을 가능하게 합니다.
MiniMax Sparse Attention (MSA) 및 1M-토큰 컨텍스트
MiniMax Sparse Attention (MSA)은 1M-토큰 컨텍스트를 실용적으로 만들기 위한 핵심 아키텍처 혁신입니다. 전체 KV 캐시 전체에 대한 밀집 어텐션 대신, MSA는 인덱스 경로를 사용해 128-토큰 KV 블록을 점수화하고 실제 어텐션 연산에 가장 관련성 높은 블록만 선택합니다.
MSA 실행 프로세스
각 쿼리 토큰은 어텐션 작업을 최소화하기 위해 세 단계 프로세스를 따릅니다:
- Block Scoring: 작은 인덱스 헤드가 후보 KV 블록에 점수를 매깁니다.
- Block Selection: 시스템은 학습된 점수와 설정된 규칙에 따라 top‑k 블록을 선택합니다 (예: 현재 레시피는
local_blocks=1을 사용해 쿼리 토큰 근처의 로컬 윈도우 블록을 보존합니다). - Sparse GQA: 선택된 KV 블록에 대해서만 온라인‑소프트맥스 어텐션이 실행됩니다.
KV 캐시 통합
MiniMax M3는 KV 데이터를 일반 페이지 KV 형태로 저장하여, vLLM이 간단한 캐시 관리자를 유지하면서 연산 경로에서 희소성을 적용할 수 있게 합니다. 이 아키텍처는 프리픽스 캐싱 및 청크 프리필을 지원하며, 이는 코드베이스나 다중 턴 에이전트 트레이스와 같이 긴 프롬프트를 재사용하는 워크로드에 필수적입니다.
멀티모달 기능 및 도구 사용
MiniMax M3는 텍스트와 함께 이미지 및 비디오 입력을 처리할 수 있는 네이티브 멀티모달 모델입니다.
멀티모달 요청 경로
GPU 활용도를 최적화하기 위해, vLLM은 CPU 측 전처리(프레임 디코딩, 비디오 샘플링, 이미지 리사이징 및 정규화)가 상류에서 수행되는 경로를 구현합니다. 이를 통해 vLLM 워커는 바로 실행 가능한 텐서를 받아 GPU 시간을 미디어 처리 대신 추론에 할당할 수 있습니다.
에이전시 워크플로우
이번 릴리스에는 에이전시 행동을 지원하기 위한 모델 전용 파서와 제어 기능이 포함됩니다:
- Tool and Reasoning Parsers:
minimax_m3툴 호출 및 추론 파서는 모델 전용 텍스트 규약을 구조화된 API 응답으로 변환합니다. - Thinking Mode: 사용자는
chat_template_kwargs를 통해enabled,disabled,adaptive와 같은 모드로 사고 행동을 제어할 수 있습니다.
성능 최적화 및 서빙 스택
EAGLE3를 활용한 추측 디코딩
Day-0 지원에는 Inferact/MiniMax-M3-EAGLE3 초안 모델을 활용한 EAGLE3 추측 디코딩이 포함됩니다. 낮은 지연 시간을 유지하기 위해 vLLM은 MSA 디코드 커널을 업데이트하여 일관된 decode_query_len을 지원하도록 했으며, 이를 통해 추측 검증이 느린 프리필 커널로 되돌아가는 대신 디코드 전용 split‑K 경로를 사용할 수 있게 했습니다.
하드웨어별 백엔드
서빙은 NVIDIA와 AMD 하드웨어 모두에 최적화되었습니다:
- NVIDIA: MSA에 기본 어텐션 백엔드를 사용하고, 비전 인코더에 FlashInfer 백엔드를 사용합니다. MXFP8 체크포인트는 Blackwell 클래스 시스템에서 DeepGEMM MXFP8 MoE 백엔드를, Hopper 클래스 시스템에서 Marlin MXFP8을 활용합니다.
- AMD ROCm: MSA에 Triton 어텐션 백엔드를 사용하고, 비전 인코더에 ROCM_AITER_FA 백엔드를 사용합니다. 이는 MI300 및 MI350 시리즈 GPU에서 검증되었습니다.
커널 융합
HBM 왕복 횟수와 런치 오버헤드를 줄이기 위해 vLLM은 QKNorm + RoPE + KV 삽입 및 GemmaNorm과 AllReduce 결합과 같은 여러 융합을 구현했습니다.
RL 사후 학습 통합
추론을 넘어, vLLM 서빙 경로는 강화 학습 사후 학습을 가능하게 합니다. NVIDIA NeMo RL은 이제 MiniMax M3에 대한 비동시 생성 백엔드로 vLLM을 활용하며, 전문가 병렬성을 사용한 BF16 체크포인트에 대한 Group Relative Policy Optimization (GRPO) 사후 학습을 지원합니다.
기술 로드맵
vLLM에서 MiniMax M3에 대한 향후 최적화에는 다음이 포함됩니다:
- FP8 Indexer and KV-Cache: 메모리 압력을 줄이고 배치 용량을 늘립니다.
- TRTLLM-Gen MoE: MXFP8 전문가 실행에 대한 Blackwell 성능을 향상시킵니다.
- Context Parallelism: 단일 노드 용량을 초과하는 컨텍스트에 대한 프리필을 확장합니다.
- Disaggregated Serving: NIXL 및 프리필/디코드 분리 레시피를 확장합니다.
SUMMARY: vLLM은 MiniMax M3 모델 패밀리에 대한 day-0 지원을 출시했으며, MiniMax Sparse Attention (MSA)를 사용해 1M-토큰 컨텍스트와 네이티브 멀티모달 추론을 효율적으로 서빙할 수 있게 되었습니다.
TITLE: MiniMax M3 vLLM 지원: 1M-토큰 멀티모달 추론을 위한 Day-0 서빙