PipeNetwork/kimi-k3-mlx
MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis
何を解決するか
このプロジェクトは、MoonshotのKimi-K3という巨大なネイティブマルチモーダルMixture-of-Experts(MoE)モデルのMLXポートを提供します。フルモデルは、現存するすべてのApple Siliconマシンに収まらないほど大きいため(最小の未圧縮層でも約883 GB必要)、本プロジェクトではストリーミングコンバーターとプリューニングシステムを実装し、ハイエンドMacハードウェア上で実行可能にしています。
仕組み
- アーキテクチャの移植: SiTU-GLU活性化、Attention Residuals(AttnRes)、LatentMoE、および3D/動画対応の専用ビジョンタワー(MoonViT)を含む、Kimi-K3の特定コンポーネントをMLXで実装しています。
- ストリーミング変換: 5.6 TB(bf16)のモデルをチャンク単位で処理するカスタムコンバーターにより、RAMに全モデルをロードする必要がありません。
- REAPプリューニング: キャリブレーションセットを用いてエキスパートの重要度を評価するREAP法を採用し、M3 Ultraの512 GBメモリ制限内に収まるサイズまでモデルを圧縮できます。
- 量子化:
mxfp4量子化をネイティブでサポートしており、ソース重みをゼロの算術誤差でMLXに再解釈できます。 - マルチモーダル統合: カスタムラッパーにより、画像プレースホルダーを完全な特徴ブロックに展開し、ビジョンタワーの出力をテキストタワーの入力に正しく統合します。
対象ユーザー
ハイエンドApple Siliconハードウェア(特に大容量のユニファイドメモリを搭載している)を持つ開発者や研究者で、MoonshotのKimi-K3マルチモーダルモデルをローカルで実行したい方。
特徴
- ビット正確なポート:
mxfp4層はソース重みとビット単位で正確に一致します。 - LMM機能: 27層のMoonViTビジョンタワーにより、画像および動画入力に対応します。
- メモリ最適化: エキスパートプリューニングを実装し、2.78Tパラメータのモデルをコンシューマー向け(ただしハイエンド)Macハードウェアに搭載可能にしています。
- 検証スイート: ビジョンのパリティ、プレースホルダー展開、変換のループテストを含む包括的なテストが用意されています。
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch