Xiaomi MiMo-V2.5-Pro-UltraSpeed 릴리스 노트

Xiaomi는 초당 1,000 토큰(TPS) 디코딩 속도 장벽을 깨뜨린 1조(1T) 파라미터 모델인 MiMo-V2.5-Pro-UltraSpeed를 출시했습니다. Cerebras나 Groq와 같은 특수 하드웨어에 의존하는 경쟁사들과 달리, Xiaomi는 MiMo 모델 팀과 TileRT 시스템 팀 간의 "extreme model-system codesign" 과정을 통해 표준 범용 GPU 노드에서 이 성능을 달성했습니다.

추론 속도의 기술적 돌파구

Xiaomi는 공격적인 양자화, 투기적 디코딩(speculative decoding), 그리고 재설계된 실행 모델을 결합하여 단일 표준 8-GPU 범용 노드에서 1,000+ TPS를 달성했습니다.

Mixed-Precision FP4 양자화

메모리 사용량과 대역폭 압박을 줄이기 위해 Xiaomi는 MXFP4 양자화 형식을 사용했습니다. 4비트 양자화와 일반적으로 관련된 복잡한 추론 및 논리 저하를 방지하기 위해, 팀은 다음과 같은 선택적 전략을 적용했습니다:

  • MoE Experts: 파라미터의 대부분을 차지하며 양자화에 더 관대한 Mixture of Experts (MoE) 구성 요소만 FP4로 양자화되었습니다.
  • Other Modules: 다른 모든 모듈은 원래의 정밀도를 유지했습니다.
  • Optimization: Quantization-Aware Training (QAT)을 사용하여 전체 모델 성능이 원래의 FP8 버전과 실질적으로 대등하게 유지되도록 보장했습니다.

DFlash Speculative Decoding

MiMo-V2.5-Pro-UltraSpeed는 블록 수준의 마스크 병렬 예측 방법인 DFlash를 구현합니다. 이는 전통적인 자기회귀적 초안 작성(한 번에 하나의 토큰을 예측하는 방식)을 단일 순방향 패스(forward pass)에서 초안 모델이 마스크된 위치의 전체 블록을 채우는 시스템으로 대체합니다.

주요 최적화 사항은 다음과 같습니다:

  • Sliding Window Attention (SWA): 초안 모델은 SWA를 사용하여 예측당 계산량을 컨텍스트 길이 선형 방식에서 상수로 줄입니다.
  • Local Sharding: 교차 장치 통신 오버헤드를 피하기 위해 마스크 신호 샘플링은 GPU-local shards에서 처리됩니다.
  • Performance: 코딩 시나리오에서 시스템은 검증 라운드당 평균 6.30 토큰의 수락 길이를 달성합니다 (블록 크기 8 기준).

TileRT Execution Model

TileRT 추론 시스템은 연산자 경계 및 하드웨어 동기화로 인해 발생하는 "실행 간극(execution gaps)"을 제거합니다. 이 시스템은 두 가지 주요 아키텍처 변화를 도입합니다:

  1. Persistent Engine Kernel: 전체 계산 파이프라인이 GPU 내에 상주하며 흐르도록 유지되어, Tensor Cores가 계산하는 동안 데이터가 메모리 계층 구조를 통해 흐를 수 있도록 지속적인 프리페칭(prefetching)을 가능하게 합니다.
  2. Warp Specialization: 통신, 데이터 이동, 텐서 계산이 물리적으로 분해됩니다. 서로 다른 스레드 그룹(Warps)이 독립적으로 작동하며 정밀하게 조정되어, GPU를 이종 실행 시스템으로 취급합니다.

애플리케이션 패러다임 및 사용 사례

1,000 TPS 장벽을 깨뜨리는 것은 1T 파라미터 모델의 유용성을 비동기식 도구에서 실시간 협업 도구로 변화시킵니다.

  • Reasoning via Parallelism: 높은 속도는 모델이 동일한 실제 시간 내에 수십 개의 추론 경로를 병렬로 실행(Best-of-N 또는 Tree Search)할 수 있게 하여, 원시 처리량을 사용하여 사고의 깊이와 품질을 높일 수 있게 합니다.
  • Coding Agents: 추론 지연 시간을 제거함으로써 개발자가 생성 블록을 기다리지 않고 실시간으로 코드 변경 사항을 see(보다)할 수 있는 "live prototyping"이 가능해집니다.
  • Time-Critical Decision Loops: 이 속도는 1T 모델을 고빈도 퀀트 트레이딩, 즉각적인 부정 거래 차단, 그리고 병변 분석 및 위험 예측을 위한 실시간 수술 보조에 사용할 수 있게 합니다.

가용성 및 가격

MiMo-V2.5-Pro-UltraSpeed는 2026년 6월 9일부터 6월 23일까지 신청 기반의 체험 기간을 동안 제공됩니다.

  • API Pricing: UltraSpeed API는 표준 MiMo-V2.5-Pro의 비용의 3배이며, 약 10배의 생성 속도를 제공합니다.
  • Open Source: FP4 양자화된 가중치와 DFlash 파라미터를 포함한 MiMo-V2.5-Pro-FP4-DFlash 체크포인트가 HuggingFace에 오픈 소스로 공개되었습니다.

커뮤니티 관점

업계 관찰자들과 개발자들은 이번 릴리스의 잠재력과 한계점을 모두 언급했습니다:

"프론티어 모델들은 꽤 인상적이지만, 대화형, 인간-in-the-loop 코딩에는 너무 느립니다... 빠른 에이전트가 더 파트너처럼 느껴집니다."

일부 사용자들은 TPS 메트릭의 "마케팅"적 성격을에 대해 회의적인 시각을 보였으며, 다른 사용자들은 미국 기업들에 비해 중국 제공업체들의 경쟁력 있는 가격을 강조했습니다. 기술적 비평가들은 지속성 커널(persistent kernels) 및 워프 특화화(warp specialization)와 같은 요소들이 근본적인 CUDA 개념임을 지적하며 기반 구성 요소의 참신함에 대해 의문을 제문을, 비록 1T 모델에 대한 적용 규모가 상당하다는 점은 인정했습니다.

Sources