SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
What it solves
SwiftLM은 Apple Silicon 전용으로 설계된 고성능 추론 서버입니다. Python 런타임 및 전역 인터프리터 락(GIL)의 오버헤드를 없애 macOS와 iOS에서 베어메탈 성능으로 대형 언어 모델(LLM), 비전‑언어 모델(VLM), 오디오‑언어 모델(ALM)을 실행할 수 있습니다.
How it works
Swift와 Metal로 네이티브하게 구축된 SwiftLM은 OpenAI 호환 API를 사용해 MLX 모델을 제공합니다. 제한된 하드웨어에서 거대한 모델을 다루기 위해 다음과 같은 고급 최적화 기술을 적용했습니다:
- SSD Expert Streaming: Mixture of Experts(MoE) 모델의 경우, 전문가 가중치를 NVMe SSD에서 직접 GPU로 스트리밍합니다. 이를 통해 Qwen3.5-397B와 같은 모델을 RAM이 64GB에 불과한 머신에서도 실행할 수 있습니다.
- TurboQuantization: 하이브리드 KV 캐시 압축 아키텍처로, FP16 대비 약 3.5배 적은 메모리를 사용하면서 정확도 손실은 최소에 불과합니다. 비선형 Lloyd‑Max 코드북을 사용해 결합된 Metal 셰이더에서 처리합니다.
- Speculative Decoding: 작은 초안 모델이 토큰을 예측하고, 큰 메인 모델이 일괄 검증함으로써 RAM 내 추론을 가속합니다.
- Native Multimodal Support: 비전(
--vision) 및 오디오(--audio) 처리를 위한 전용 플래그를 제공하며, 실시간 이미지 파싱과 AVFoundation을 통한 오디오 입력을 지원합니다.
Who it’s for
- Apple Silicon 사용자: Mac 또는 iPhone/iPad에서 가능한 가장 빠른 로컬 LLM 추론을 원하는 개발자 및 연구자.
- 메모리 제한 사용자: 소비자급 Apple 하드웨어에서 100B 이상 파라미터를 가진 최첨단 MoE 모델을 실행하려는 사용자.
- iOS 개발자: 포함된 SwiftBuddy companion 앱을 통해 장치 내 MLX 추론을 모바일 애플리케이션에 통합하려는 개발자.
Highlights
- OpenAI-Compatible: OpenAI SDK를 바로 대체할 수 있습니다.
- 100% Native: Python이 필요 없으며 단일 바이너리로 컴파일됩니다.
- Massive MoE Support: SSD 스트리밍으로 과도한 모델에 최대 10배 속도 향상을 제공합니다.
- KV Cache Compression: TurboQuant를 사용하면 24GB RAM 머신에서도 100k 컨텍스트 윈도우를 처리할 수 있습니다.
- Multimodal: VLM(예: Qwen2-VL) 및 ALM(예: Gemma 4 Omni)을 네이티브로 지원합니다.