PipeNetwork/kimi-k3-mlx
MLX port of moonshotai/Kimi-K3 (2.78T multimodal MoE): streaming converter, REAP expert pruning, and per-language expert-overlap analysis
해결하는 문제
이 프로젝트는 Moonshot의 Kimi-K3, 즉 거대한 네이티브 멀티모달 Mixture-of-Experts (MoE) 모델의 MLX 포트를 제공합니다. 전체 모델은 현재 존재하는 모든 Apple Silicon 기기에는 들어가지 못할 정도로 크기 때문에 (최소 미압축 계층 기준 약 883GB 필요), 본 프로젝트는 스트리밍 컨버터와 프리닝 시스템을 구현하여 고성능 맥 하드웨어에서 실행 가능하게 합니다.
작동 방식
- 아키텍처 포팅: SiTU-GLU 활성화, Attention Residuals (AttnRes), LatentMoE, 그리고 3D/비디오 기능을 위한 특화된 비전 타워(MoonViT)를 포함한 Kimi-K3의 특정 구성 요소를 MLX에 구현합니다.
- 스트리밍 변환: 5.6TB(bf16) 모델을 청크 단위로 처리하는 커스텀 컨버터를 사용하여 전체 모델을 RAM에 로드할 필요 없이 처리합니다.
- REAP 프리닝: 캘리브레이션 세트를 통해 전문가의 중요도를 평가하는 REAP 방법을 사용하여 모델을 M3 Ultra의 512GB 메모리 제한 내에 맞출 수 있도록 압축합니다.
- 양자화: 소스 가중치를 재해석할 수 있는 네이티브
mxfp4양자화를 지원하며, 산술 오류 없이 MLX로 변환할 수 있습니다. - 멀티모달 통합: 이미지 플레이스홀더를 전체 특징 블록으로 확장하는 커스텀 래퍼를 통해 비전 타워의 출력을 텍스트 타워의 입력에 올바르게 통합합니다.
대상 사용자
고성능 Apple Silicon 하드웨어(특히 대용량 유니파이드 메모리를 갖춘 기기)를 보유한 개발자 및 연구자로, Moonshot의 Kimi-K3 멀티모달 모델을 로컬에서 실행하고자 하는 분들입니다.
주요 특징
- 비트 정확한 포트:
mxfp4계층은 소스 가중치와 비트 단위로 정확히 일치합니다. - LMM 기능: 27층의 MoonViT 비전 타워를 통해 이미지 및 비디오 입력을 지원합니다.
- 메모리 최적화: 전문가 프리닝을 통해 2.78T 파라미터 모델을 소비자용(다만 고성능) 맥 하드웨어에 적재할 수 있도록 합니다.
- 검증 스위트: 비전 일치성, 플레이스홀더 확장, 변환 루프 테스트를 포함한 포괄적인 테스트가 제공됩니다.
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch