PipeNetwork/kimi-k3-mlx
MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis
解決的問題
本專案提供 Moonshot 的 Kimi-K3 模型的 MLX 版本,這是一個龐大的原生多模態混合專家(MoE)模型。由於完整模型過大,無法適配任何現有的 Apple Silicon 設備(最小未剪枝層級需約 883 GB),因此本專案實作了串流轉換器與剪枝系統,使模型能在高階 Mac 硬體上執行。
工作原理
- 架構移植:在 MLX 中實作了 Kimi-K3 的特定元件,包括 SiTU-GLU 活化函數、注意力殘差(AttnRes)、LatentMoE,以及用於 3D/影片能力的專用視覺塔(MoonViT)。
- 串流轉換:自訂轉換器以分塊方式處理 5.6 TB(bf16)模型,避免將整個模型載入 RAM 中。
- REAP 剪枝:使用 REAP 方法透過校準集評估專家重要性,使模型可剪枝至適合 M3 Ultra 512 GB 記憶體上限的大小。
- 量化:支援原生
mxfp4量化,允許來源權重以零算術誤差重新解釋為 MLX 格式。 - 多模態整合:自訂包裝器處理影像佔位符擴展為完整特徵區塊,確保視覺塔輸出正確合併至文字塔輸入中。
適用對象
擁有高階 Apple Silicon 硬體(特別是大容量統一記憶體)的開發者與研究人員,希望在本地執行 Moonshot 的 Kimi-K3 多模態模型。
亮點
- 比特級精確移植:
mxfp4層與來源權重在比特層級完全一致。 - LMM 能力:透過 27 層 MoonViT 視覺塔支援影像與影片輸入。
- 記憶體優化:透過專家剪枝,使 2.78T 參數模型可在消費級(儘管是高階)Mac 硬體上執行。
- 驗證套件:包含視覺一致性、佔位符擴展與轉換往返測試的全面測試。
相關
- Dispatch
- 專案
- Dispatch
- 專案
- Dispatch