Trans-N-ai/swama

High-performance MLX-based LLM inference engine for macOS with native Swift implementation

What it solves

Swama는 macOS 사용자에게 고성능 로컬 머신러닝 런타임을 제공하여 클라우드 기반 AI 서비스를 사용할 필요가 없게 합니다. Apple Silicon 하드웨어에서 대규모 언어 모델 (LLMs), 시각 언어 모델 (VLMs), 그리고 오디오 모델 (ASR/TTS)을 직접 배포하고 사용할 수 있도록 단순화합니다.

How it works

Apple의 MLX 프레임워크를 기반으로 구축되었으며 순수 Swift로 작성된 Swama는 Apple Silicon에 최전적화된 추론을 제공합니다. 세 가지 주요 인터페이스를 제공합니다: 간편한 접근을 위한 네이티브 macOS 메뉴바 앱, 모델 관리 및 추론을 위한 명령줄 인터페이스 (CLI), 그리고 다른 애플리케이션이 로컬 모델과 통합할 수 있도록 하는 OpenAI 호환 API 서버입니다.

Who it's for

개인정보 보호, 성능, 오프라인 액세스를 위해 강력한 AI 모델을 로컬에서 실행하고자 하는 Apple Silicon (M1/M2/M3/M4) macOS 사용자, 그리고 OpenAI 호환 로컬 백엔드가 필요한 개발자.

Highlights

  • Multimodal Capabilities: 텍스트, 이미지 (VLM), 오디오 (speech-to-text 및 text-to-speech) 입출력을 지원합니다.
  • OpenAI Compatible API: 채팅 완성, embeddings, 오디오 전사(transcription)를 위한 표준 엔드포인트를 구현합니다.
  • Smart Model Management: HuggingFace에서 자동 다운로드 기능을 제공하며, 사용자 친화적인 별칭(예: qwen3, llama3.2) 시스템을 사용하여 모델 선택을리를 단순화합니다.
  • Native macOS Integration: 원활한한 시스템 레벨의 경험을 위해 전용 macOS 메뉴바 앱이 포함되어 있습니다.