SharpAI/SwiftLM

⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.

무엇을 해결하는가

SwiftLM은 Python 런타임이나 Global Interpreter Lock (GIL)의 오버헤드 없이 Apple Silicon에서 대규모 언어 모델(LLM)을 실행하도록 설계된 고성능 추론 서버입니다. Native Swift와 Metal을 활용하여 물리적 RAM을 초과하는 모델을 포함한 거대 모델의 실행을 가능하게 하며, 쉬운 통합을 위해 OpenAI 호환 API를 제공합니다.

작동 방식

이 프로젝트는 MLX 프레임워크를 활용하며 단일 네이티브 바이너리로 컴파일됩니다. Apple Silicon 성능을 극대화하기 위해 다음과 같은 몇 가지 고급 최적화 기술을 사용합니다:

  • TurboQuantization: 비선형 Lloyd-Max 코드북과 융합된 Metal 셰이더를 사용하여 메모리 사용량을 약 3.5배 줄이는 하이브리드 KV 캐시 압축 아키텍처입니다.
  • SSD Expert Streaming: Mixture of Experts (MoE) 모델을 위한 특화된 파이프라인으로, 전문가 레이어를 NVMe SSD에서 GPU로 직접 스트리밍하여 Qwen3.5-397B와 같은 모델을 제한된 RAM에서도 실행할 수 있게 합니다.
  • Speculative Decoding: 작은 초안 모델(draft model)을 사용하여 토큰을 예측하고, 더 큰 메인 모델이 이를 일괄적으로 검증하여 처리량을 높입니다.
  • Native Multimodal Support: Metal 및 AVFoundation을 사용하여 시각(--vision) 및 오디오(--audio) 처리를 위한 전용 플래그를 포함합니다.

대상 사용자

  • Apple Silicon 사용자: 최첨단 오픈 웨이트 모델을 로컬에서 최대의 효율로 실행하고자 하는 사용자.
  • 개발자: 애플리케이션을 위해 즉시 사용 가능한 OpenAI 호환 로컬 서버가 필요한 개발자.
  • iOS 개발자: 온디바이스 MLX 추론을 구현하고자 하는 iOS 개발자 (포함된 SwiftBuddy 컴패니언 앱을 통해).

주요 특징

  • 100% Native: Python이 필요하지 않으며, macOS 및 iOS용 단일 바이너리로 컴파일됩니다.
  • OpenAI-Compatible: /v1/chat/completions 및 스트리밍을 지원합니다.
  • Massive Model Support: SSD 스트리밍을 통해 100B+ 파라미터 MoE 모델을 실행할 수 있습니다.
  • Broad Model Compatibility: Gemma 4, Qwen 3.5, Llama 3.3, DeepSeek V3, Phi 4를 포함한 다양한 모델 제품군을 지원합니다.
  • KV Cache Compression: TurboQuant를 통해 긴 컨텍스트에서 상당한 메모리 절약을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트