PipeNetwork/kimi-k3-mlx

MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis

何を解決するか

このプロジェクトは、MoonshotのKimi-K3という巨大なネイティブマルチモーダルMixture-of-Experts(MoE)モデルのMLXポートを提供します。フルモデルは、現存するすべてのApple Siliconマシンに収まらないほど大きいため(最小の未圧縮層でも約883 GB必要)、本プロジェクトではストリーミングコンバーターとプリューニングシステムを実装し、ハイエンドMacハードウェア上で実行可能にしています。

仕組み

  • アーキテクチャの移植: SiTU-GLU活性化、Attention Residuals(AttnRes)、LatentMoE、および3D/動画対応の専用ビジョンタワー(MoonViT)を含む、Kimi-K3の特定コンポーネントをMLXで実装しています。
  • ストリーミング変換: 5.6 TB(bf16)のモデルをチャンク単位で処理するカスタムコンバーターにより、RAMに全モデルをロードする必要がありません。
  • REAPプリューニング: キャリブレーションセットを用いてエキスパートの重要度を評価するREAP法を採用し、M3 Ultraの512 GBメモリ制限内に収まるサイズまでモデルを圧縮できます。
  • 量子化: mxfp4量子化をネイティブでサポートしており、ソース重みをゼロの算術誤差でMLXに再解釈できます。
  • マルチモーダル統合: カスタムラッパーにより、画像プレースホルダーを完全な特徴ブロックに展開し、ビジョンタワーの出力をテキストタワーの入力に正しく統合します。

対象ユーザー

ハイエンドApple Siliconハードウェア(特に大容量のユニファイドメモリを搭載している)を持つ開発者や研究者で、MoonshotのKimi-K3マルチモーダルモデルをローカルで実行したい方。

特徴

  • ビット正確なポート: mxfp4層はソース重みとビット単位で正確に一致します。
  • LMM機能: 27層のMoonViTビジョンタワーにより、画像および動画入力に対応します。
  • メモリ最適化: エキスパートプリューニングを実装し、2.78Tパラメータのモデルをコンシューマー向け(ただしハイエンド)Macハードウェアに搭載可能にしています。
  • 検証スイート: ビジョンのパリティ、プレースホルダー展開、変換のループテストを含む包括的なテストが用意されています。

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch