Trans-N-ai/swama

High-performance MLX-based LLM inference engine for macOS with native Swift implementation

What it solves

Swama 為 macOS 用戶提供高性能的本地機器學習運行時,消除了對雲端 AI 服務的需求。它簡化了直接在 Apple Silicon 硬體上部署和使用大型語言模型 (LLMs)、視覺語言模型 (VLMs) 以及音訊模型 (ASR/TTS) 的流程。

How it works

Swama 基於 Apple 的 MLX 框架並使用純 Swift 編寫,針對 Apple Silicon 進行了推理優化。它提供三種主要的介面:一個用於輕鬆存取的原生 macOS 選單列應用程式、一個用於模型管理和推理的命令列介面 (CLI),以及一個允許其他應用程式與本地模型整合的 OpenAI 相容 API 伺服器。

Who it's for

針對想要為了隱私、性能和離線存取而希望在本地運行強大 AI 模型 的 Apple Silicon (M1/M2/M3/M4) macOS 用戶,以及需要 OpenAI 相容本地後端 的開發者。

Highlights

  • Multimodal Capabilities: 支援文字、圖像 (VLM) 以及音訊 (語音轉文字和文字轉語音) 的輸入與輸出。
  • OpenAI Compatible API: 實作了用於聊天補全、嵌入 (embeddings) 和音訊轉錄的標準端點。
  • Smart Model Management: 具備從 HuggingFace 自動下載的功能,以及一套友好的別名系統 (例如 qwen3, llama3.2) 以簡化模型選擇。
  • Native macOS Integration: 包含一個專用的選單列應用程式,以提供無縫的系統級體驗。