PipeNetwork/kimi-k3-mlx

MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis

解决的问题

本项目提供了 Moonshot 的 Kimi-K3 模型的 MLX 版本,这是一个巨大的原生多模态混合专家(MoE)模型。由于完整模型过大,无法适配任何现有的 Apple Silicon 设备(最小未剪枝层级需约 883 GB),因此本项目实现了流式转换器和剪枝系统,使模型能够在高端 Mac 硬件上运行。

工作原理

  • 架构移植:在 MLX 中实现了 Kimi-K3 的特定组件,包括 SiTU-GLU 激活函数、注意力残差(AttnRes)、LatentMoE,以及用于 3D/视频能力的专用视觉塔(MoonViT)。
  • 流式转换:自定义转换器以分块方式处理 5.6 TB(bf16)模型,避免将整个模型加载到 RAM 中。
  • REAP 剪枝:使用 REAP 方法通过校准集对专家重要性进行评分,使模型可剪枝至适合 M3 Ultra 512 GB 内存上限的大小。
  • 量化:支持原生 mxfp4 量化,允许源权重以零算术误差重新解释为 MLX 格式。
  • 多模态集成:自定义包装器处理图像占位符扩展为完整特征块,确保视觉塔输出正确合并到文本塔输入中。

适用人群

拥有高端 Apple Silicon 硬件(特别是大容量统一内存)的开发者和研究人员,希望在本地运行 Moonshot 的 Kimi-K3 多模态模型。

亮点

  • 比特级精确移植mxfp4 层与源权重在比特级别完全一致。
  • LMM 能力:通过 27 层 MoonViT 视觉塔支持图像和视频输入。
  • 内存优化:通过专家剪枝,使 2.78T 参数模型可在消费级(尽管是高端)Mac 硬件上运行。
  • 验证套件:包含视觉一致性、占位符扩展和转换往返测试的全面测试。

相关

  • Dispatch
  • 项目
  • Dispatch
  • 项目
  • Dispatch