Trans-N-ai/swama
High-performance MLX-based LLM inference engine for macOS with native Swift implementation
What it solves
Swama 为 macOS 用户提供高性能的本地机器学习运行时,消除了对云端 AI 服务的需求。它简化了直接在 Apple Silicon 硬件上部署和使用大语言模型 (LLMs)、视觉语言模型 (VLMs) 以及音频模型 (ASR/TTS) 的部署和使用。
How it works
Swama 基于 Apple 的 MLX 框架并使用纯 Swift 编写,并针对 Apple Silicon 进行了推理优化。它提供三种主要的接口:一个用于轻松访问的原生 macOS 菜单栏应用、一个用于模型管理和推理的命令行界面 (CLI),以及一个允许其他应用程序集成到本地模型的 OpenAI 兼容 API 服务器。
Who it's for
针对想要为了隐私、性能和离线访问而希望在本地运行强大 AI 模型的 Apple Silicon (M1/M2/M3/M4) macOS 用户,以及需要 OpenAI 兼容本地后端的开发者。
Highlights
- Multimodal Capabilities: 支持文本、图像 (VLM) 和音频 (speech-to-text 和 text-to-speech) 的输入和输出。
- OpenAI Compatible API: 实现了一套用于聊天补全、embeddings、音频转录的 standard 接口端点。
- Smart Model Management: 具备从 HuggingFace 自动下载的功能,以及一套友好的别名系统 (例如
qwen3,llama3.2) 以简化模型选择。 - Native macOS Integration: 包括一个专用的菜单栏应用程序,以实现 seamless 系统的级体验。