小米 MiMo-V2.5-Pro-UltraSpeed 发布说明

小米发布了 MiMo-V2.5-Pro-UltraSpeed,这是一个拥有 1 万亿 (1T) 参数的模型,打破了每秒 1,000 个 token (TPS) 的解码速度障碍。与依赖 Cerebras 或 Groq 等专用硬件的竞争对手不同,小米通过 MiMo 模型团队与 TileRT 系统团队之间的“极致模型-系统协同设计”过程,在标准的通用 GPU 节点上实现了这一性能。

推理速度的技术突破

小米通过结合激进的量化、投机采样 (speculative decoding) 和重新设计的执行模型,在使用单个标准 8-GPU 通用 GPU 节点的情况下实现了 1,000+ TPS。

混合精度 FP4 量化

为了减少内存占用和带宽压力,小米采用了 MXFP4 量化格式。为了防止通常与 4-bit 量化相关的复杂推理和逻辑能力的下降,团队应用了选择性策略:

  • MoE Experts: 仅对混合专家 (MoE) 组件——这些组件占据了参数的大部分且对量化更具容忍度——进行了 FP4 量化。
  • 其他模块: 所有其他模块保留了原始精度。
  • 优化: 使用了量化感知训练 (QAT) 以确保整体模型能力基本与原始 FP8 版本持平。

DFlash 投机采样

MiMo-V2.5-Pro-UltraSpeed 实现了 DFlash,一种块级掩码并行预测方法。它取代了传统的自回归草稿生成 (which predicts one token at a time),转而使用一个系统,使草稿模型在单次前向传播中填满整个掩码位置块。

关键优化包括:

  • Sliding Window Attention (SWA): 草稿模型使用 SWA 来将单次预测的计算量从随上下文长度线性增长降低为常数。
  • Local Sharding: 掩码信号采样在 GPU 本地分片上处理,以避免跨设备通信开销。
  • 性能: 在编程场景中,该系统在每次验证轮次中实现了平均 6.30 个 token 的接受长度(块大小为 8)。

TileRT 执行模型

TileRT 推理系统消除了由算子边界和硬件同步引起的“执行间隙”。它引入了两个主要的架构转变:

  1. Persistent Engine Kernel: 整个计算流水线驻留在 GPU 内部并持续流动,从而实现连续预取,使得数据在 Tensor Cores 进行计算时能够流经内存层级结构。
  2. Warp Specialization: 通信、数据移动和张量计算在物理上进行了分解。不同的线程组 (Warps) 独立运行并进行精确协调,将 GPU 视为一个异构执行系统。

应用范式与用例

打破 1,000 TPS 障碍将 1T 参数模型的效用从异步工具转变为实时协作工具。

  • 通过并行化进行推理: 高速性能允许模型在相同的墙钟时间内并行运行数十条推理路径(Best-of-N 或 Tree Search),利用原始吞吐量来增加思维的深度和质量。
  • Coding Agents: 推理延迟的消除使得“实时原型设计”成为可能,开发者可以在不等待生成块的情况下实时看到代码更改。
  • 时间敏感型决策循环: 这种速度使得 1T 模型可以用于高频量化交易、即时反欺诈拦截以及用于病灶分析和风险预测的实时手术辅助。

可用性与定价

MiMo-V2.5-Pro-UltraSpeed 可通过申请制试用窗口期进行,时间为 2026 年 6 月 9 日至 6 月 23 日

  • API 定价: UltraSpeed API 的价格是标准 MiMo-V2.5-Pro 的 3 倍,但提供了大约 10 倍的生成速度。
  • 开源: MiMo-V2.5-Pro-FP4-DFlash 检查点(包括 FP4 量化权重和 DFlash 参数)已在 HuggingFace 上开源。

社区观点

行业观察者和开发者都注意到了这次发布的潜力与局限性:

"前沿模型已经变得相当令人印象深刻,但它们对于交互式、人机协作编程来说还是有点太慢了……一个快速的 Agent 感觉更像是一个伙伴。"

一些用户对 TPS 指标的“营销”性质表示怀疑,而另一些人则强调了中国供应商与美国同行相比的竞争性定价。技术批评者质疑了底层组件的新颖性,这表明 persistent kernels 和 warp specialization 等元素是基础的 CUDA concept,尽管将其应用于 1T 模型规模的意义仍然重大。

Sources