Xiaomi MiMo-V2.5-Pro-UltraSpeed リリースノート

Xiaomiは、1,000トークン/秒(TPS)のデコード速度の壁を打ち破る1兆(1T)パラメータモデル、MiMo-V2.5-Pro-UltraSpeedをリリースしました。CerebrasやGroqのような専用ハードウェアに依存する競合他社とは異なり、XiaomiはMiMoモデルチームとTileRTシステムチームによる「極限のモデル・システム・コデザイン」プロセスを通じて、標準的な汎用GPUノード上でこのパフォーマンスを実現しています。

推論速度における技術的突破口

Xiaomiは、積極的な量子化、投機的デコード、および再設計された実行モデルを組み合わせることで、単一の標準的な8-GPU汎用ノードを使用して1,000+ TPSを達成しました。

混合精度FP4量子化

メモリフットプリントと帯域幅の圧力を軽減するため、XiaomiはMXFP4量子化フォーマットを利用しました。4ビット量子化に伴う複雑な推論や論理の劣化を防ぐため、チームは選択的な戦略を採用しました:

  • MoE Experts: Mixture of Experts (MoE) コンポーネント(パラメータの大部分を占め、量子化に対してより耐性がある)のみをFP4に量子化しました。
  • その他のモジュール: その他のすべてのモジュールは元の精度を維持しました。
  • 最適化: 量子化を意識したトレーニング(Quantization-Aware Training: QAT)を使用することで、モデル全体の能力が元のFP8バージョンと実質的に同等であることを確認しました。

DFlash 投機的デコード

MiMo-V2.5-Pro-UltraSpeedは、ブロックレベルのマスクされた並列予測手法であるDFlashを実装しています。これは、従来の自己回帰的なドラフティング(一度に1つのトークンを予測する手法)に代わり、ドラフトモデルが単一のフォワードパスでマスクされた位置のブロック全体を埋めるシステムです。

主な最適化には以下が含まれます:

  • Sliding Window Attention (SWA): ドラフトモデルはSWAを使用して、予測ごとの計算量をコンテキスト長に比例する線形から定数へと削減します。
  • Local Sharding: マスク信号のサンプリングは、デバイス間通信のオーバーヘッドを避けるため、GPUローカルのシャード上で処理されます。
  • パフォーマンス: コーディングのシナリオにおいて、システムは検証ラウンドあたり平均6.30トークンの受け入れ長(ブロックサイズ8のうち)を達成しています。

TileRT 実行モデル

TileRT推論システムは、オペレータの境界やハードウェアの同期によって引き起こされる「実行ギャップ」を排除します。これは、主に2つのアーキテクチャ上の転換を導入しています:

  1. Persistent Engine Kernel: 計算パイプライン全体がGPU内に常駐し、流れ続ける状態を維持します。これにより、継続的なプリフェッチが可能になり、Tensor Coresが計算を行っている間にデータがメモリ階層を流れるようになります。
  2. Warp Specialization: 通信、データの移動、およびテンソル計算が物理的に分解されます。異なるスレッドグループ(Warps)が独立して、かつ精密に連携して動作し、GPUをヘテロジニアスな実行システムとして扱います。

アプリケーション・パラダイムとユースケース

1,000 TPSの壁を突破したことは、1Tパラメータモデルの有用性を、非同期的なツールからリアルタイムの協力者へと変貌させます。

  • 並列化による推論: 高速化により、モデルは同じ実時間内で数十の推論パス(Best-of-NまたはTree Search)を並列に実行できるようになり、生の帯域幅を利用して思考の深さと質を高めることができます。
  • Coding Agents: 推論レイテンシの解消により、「ライブ・プロトタイピング」が可能になります。開発者は生成ブロックを待つことなく、コードの変更をリアルタイムで確認できます。
  • 時間的に重要な意思決定ループ: この速度により、1Tモデルは、高頻度なクオンツ・トレーディング、即時の不正検知、および病変分析やリスク予測のためのリアルタイムの手術支援に利用可能になります。

入手可能性と価格設定

MiMo-V2.5-Pro-UltraSpeedは、2026年6月9日から6月23日までの、申請ベースの試用期間が設けられています。

  • API Pricing: UltraSpeed APIの価格は、標準的なMiMo-V2.5-Proの3倍ですが、生成速度は約10倍に達します。
  • Open Source: FP4量子化された重みとDFlashパラメータを含むMiMo-V2.5-Pro-FP4-DFlashチェックポイントは、HuggingFaceでオープンソース化されています。

コミュニティの視点

業界のオブザーバーや開発者は、このリリースの潜在能力と限界の両方に言及しています。

"Frontierモデルは非常に印象的になっていますが、インタラクティブな、人間が介在するコーディングにおいては、どれも少し遅すぎます... 高速なエージェントは、パートナーのような感覚を与えます。"

一部のユーザーは、TPSメトリクスの「マーケティング」的な性質に対して懐疑的な見解を示しましたが、一方で、中国のプロバイダーが米国と比較して競争力のある価格設定を行っていることを強調しました。技術的な批評家は、基礎となるコンポーネントの新規性について疑問を呈しており、persistent kernelやwarp specializationのような要素は基本的なCUDA概念であると示唆していますが、1Tモデルへの適用規模は依然として重要です。

Sources