RunanywhereAI/wally

Get up and running with GLM-5.3-flash, DeepSeek, Qwen, Gemma and other open source frontier models.

解决的问题

Wally 是一个终端工具,允许用户在自己的硬件上本地运行开源 AI 模型,或在本地机器资源不足时使用托管版本。它简化了下载、管理和与多种 AI 模态(包括文本、视觉、语音和嵌入)交互的过程,无需复杂的配置或本地使用的 API 密钥。

工作原理

Wally 作为多个 AI 后端(如 llama.cpp、MLX、Sherpa-ONNX 和 ONNX Runtime)的统一接口。它会根据硬件(例如 Apple Silicon GPU、Windows ARM64 NPU)和模型格式自动选择最佳可用引擎。用户可以从模型目录或 Hugging Face GGUF 文件中拉取模型,并通过简单的 CLI 命令运行。对于托管模型,它与 RunAnywhere 控制台集成,提供按使用量计费的访问。

适用人群

专为开发者和高级用户设计,希望从终端快速、注重隐私地运行 LLM 和其他 AI 模型,或希望将 AI 模型集成到 Claude Code、Claude Desktop 和 JetBrains IDE(CLion、RustRover)等编码工具中的人群。

主要亮点

  • 多模态支持:支持 LLM、视觉-语言模型(VLM)、文本转语音(TTS)、语音转文本(STT)、嵌入和图像生成。
  • 混合本地/云端:通过单一 CLI 命令无缝在本地执行和托管模型之间切换。
  • 硬件特定优化:利用 Apple 的 Metal/MLX 和高通的 Hexagon NPU 等专用硬件。
  • 工具集成:一键命令即可将模型接入主流编码代理和 IDE。
  • OpenAI 兼容 API:可将模型作为本地 HTTP 端点提供给其他应用程序。

相关

  • 项目
  • 项目
  • 项目
  • 项目