PipeNetwork/kimi-k3-mlx

MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis

解決的問題

本專案提供 Moonshot 的 Kimi-K3 模型的 MLX 版本,這是一個龐大的原生多模態混合專家(MoE)模型。由於完整模型過大,無法適配任何現有的 Apple Silicon 設備(最小未剪枝層級需約 883 GB),因此本專案實作了串流轉換器與剪枝系統,使模型能在高階 Mac 硬體上執行。

工作原理

  • 架構移植:在 MLX 中實作了 Kimi-K3 的特定元件,包括 SiTU-GLU 活化函數、注意力殘差(AttnRes)、LatentMoE,以及用於 3D/影片能力的專用視覺塔(MoonViT)。
  • 串流轉換:自訂轉換器以分塊方式處理 5.6 TB(bf16)模型,避免將整個模型載入 RAM 中。
  • REAP 剪枝:使用 REAP 方法透過校準集評估專家重要性,使模型可剪枝至適合 M3 Ultra 512 GB 記憶體上限的大小。
  • 量化:支援原生 mxfp4 量化,允許來源權重以零算術誤差重新解釋為 MLX 格式。
  • 多模態整合:自訂包裝器處理影像佔位符擴展為完整特徵區塊,確保視覺塔輸出正確合併至文字塔輸入中。

適用對象

擁有高階 Apple Silicon 硬體(特別是大容量統一記憶體)的開發者與研究人員,希望在本地執行 Moonshot 的 Kimi-K3 多模態模型。

亮點

  • 比特級精確移植mxfp4 層與來源權重在比特層級完全一致。
  • LMM 能力:透過 27 層 MoonViT 視覺塔支援影像與影片輸入。
  • 記憶體優化:透過專家剪枝,使 2.78T 參數模型可在消費級(儘管是高階)Mac 硬體上執行。
  • 驗證套件:包含視覺一致性、佔位符擴展與轉換往返測試的全面測試。

相關

  • Dispatch
  • 專案
  • Dispatch
  • 專案
  • Dispatch