Xiaomi MiMo-V2.5-Pro-UltraSpeed 發佈說明

Xiaomi 已發佈 MiMo-V2.5-Pro-UltraSpeed,這是一款擁有 1 兆 (1T) 參數的模型,打破了每秒 1,000 個 token (TPS) 的解碼速度障礙。與依賴 Cerebras 或 Groq 等專用硬體的競爭對手不同,Xiaomi 透過 MiMo 模型團隊與 TileRT 系統團隊之間的「極端模型-系統協同設計 (extreme model-system codesign)」流程,在標準的通用 GPU 節點上實現了此性能。

推論速度的技術突破

Xiaomi 透過結合激進的量化、投機解碼 (speculative decoding) 以及重新設計的執行模型,在單個標準 8-GPU 通用節點上實現了 1,000+ TPS。

混合精度 FP4 量化

為了減少記憶體佔用和頻寬壓力,Xiaomi 使用了 MXFP4 量化格式。為了防止通常與 4-bit 量化相關的複雜推理和邏輯能力下降,團隊採用了選擇性策略:

  • MoE Experts: 僅對混合專家模型 (Mixture of Experts, MoE) 組件——其佔據了大部分參數且對量化具有較高的容忍度——進行 FP4 量化。
  • 其他模組: 所有其他模組均保留其原始精度。
  • 優化: 使用了量化感知訓練 (Quantization-Aware Training, QAT) 以確保整體模型能力基本上與原始 FP8 版本持平。

DFlash 投機解碼

MiMo-V2.5-Pro-UltraSpeed 實作了 DFlash,這是一種區塊級別的遮罩平行預測方法。這取代了傳統的自回歸草稿生成 (autoregressive drafting,即一次預測一個 token),改由一個草稿模型在單次前向傳播中填滿整個遮罩位置的區塊。

關鍵優化包括:

  • Sliding Window Attention (SWA): 草稿模型使用 SWA 來將每次預測的計算量從與上下文長度成線性關係降低為常數。
  • Local Sharding: 遮罩訊號採樣在 GPU 本地分片 (shards) 上處理,以避免跨設備通訊開銷。
  • 性能: 在程式碼編寫場景中,該系統在每次驗證輪次中平均可接受長度為 6.30 個 tokens (區塊大小為 8)。

TileRT 執行模型

TileRT 推論系統消除了由算子邊界和硬體同步引起的「執行間隙 (execution gaps)」。它引入了兩個主要的架構轉變:

  1. Persistent Engine Kernel: 整個計算管線在 GPU 內保持常駐並持續流動,從而實現連續預取 (prefetching),使得數據在 Tensor Cores 進行計算時能流經記憶體層級結構。
  2. Warp Specialization: 通訊、數據移動和張量計算在物理上被分解。不同的執行緒組 (Warps) 獨立運作並進行精確協調,將 GPU 視為一個異構執行系統。

應用範式與使用案例

打破 1,000 TPS 障礙將 1T 參數模型的實用性從非同步工具轉變為即時協作夥伴。

  • 透過平行化進行推理: 高速性能允許模型在相同的牆鐘時間 (wall-clock time) 內平行運行數十條推理路徑 (Best-of-N 或 Tree Search),利用原始吞吐量來增加思考的深度和品質。
  • Coding Agents: 推論延遲的消除使得「即時原型設計 (live prototyping)」成為可能,開發者可以即時看到程式碼變更,而無需等待生成區塊。
  • 時間敏感型決策迴圈: 速度使得 1T 模型可用於高頻量化交易、即時反詐騙攔截,以及用於病灶分析和風險預測的即時手術輔助。

可用性與定價

MiMo-V2.5-Pro-UltraSpeed 可透過申請制試用窗口期進行體驗,時間為 2026 年 6 月 9 日至 6 月 23 日

  • API 定價: UltraSpeed API 的定價為標準 MiMo-V2.5-Pro 的 3 倍,但提供了大約 10 倍的生成速度。
  • Open Source: MiMo-V2.5-Pro-FP4-DFlash 檢查點 (checkpoint) 已在 HuggingFace 上開源。

社群觀點

業界觀察家和開發者對此版本的發佈都提出了潛在能力與限制的看法:

「前沿模型已經變得相當令人印象深刻,但對於互動式、人機協作的程式碼編寫來說,它們都太慢了... 一個快速的 Agent 會讓人感覺更像是一個夥伴。」

一些用戶對 TPS 指標的「行銷」性質表示懷疑,而其他人則強調了中國供應商與美國對手相比的競爭性定價。技術評論家質疑了底層組件的新穎性,認為 persistent kernels 和 warp specialization 等元素是基礎的 CUDA concept,儘管將其應用於 1T 模型規模的規模化應用仍然具有重大意義。

Sources