RunanywhereAI/wally
Get up and running with GLM-5.3-flash, DeepSeek, Qwen, Gemma and other open source frontier models.
解决的问题
Wally 是一个终端工具,允许用户在自己的硬件上本地运行开源 AI 模型,或在本地机器资源不足时使用托管版本。它简化了下载、管理和与多种 AI 模态(包括文本、视觉、语音和嵌入)交互的过程,无需复杂的配置或本地使用的 API 密钥。
工作原理
Wally 作为多个 AI 后端(如 llama.cpp、MLX、Sherpa-ONNX 和 ONNX Runtime)的统一接口。它会根据硬件(例如 Apple Silicon GPU、Windows ARM64 NPU)和模型格式自动选择最佳可用引擎。用户可以从模型目录或 Hugging Face GGUF 文件中拉取模型,并通过简单的 CLI 命令运行。对于托管模型,它与 RunAnywhere 控制台集成,提供按使用量计费的访问。
适用人群
专为开发者和高级用户设计,希望从终端快速、注重隐私地运行 LLM 和其他 AI 模型,或希望将 AI 模型集成到 Claude Code、Claude Desktop 和 JetBrains IDE(CLion、RustRover)等编码工具中的人群。
主要亮点
- 多模态支持:支持 LLM、视觉-语言模型(VLM)、文本转语音(TTS)、语音转文本(STT)、嵌入和图像生成。
- 混合本地/云端:通过单一 CLI 命令无缝在本地执行和托管模型之间切换。
- 硬件特定优化:利用 Apple 的 Metal/MLX 和高通的 Hexagon NPU 等专用硬件。
- 工具集成:一键命令即可将模型接入主流编码代理和 IDE。
- OpenAI 兼容 API:可将模型作为本地 HTTP 端点提供给其他应用程序。
相关
- 项目
- 项目
- 项目
- 项目