RunanywhereAI/wally
Get up and running with GLM-5.3-flash, DeepSeek, Qwen, Gemma and other open source frontier models.
解決的問題
Wally 是一個終端工具,允許使用者在自己的硬體上本地執行開源 AI 模型,或在本地機器資源不足時使用託管版本。它簡化了下載、管理與多種 AI 模態(包括文字、視覺、語音和嵌入)互動的過程,無需複雜的設定或本地使用的 API 金鑰。
工作原理
Wally 作為多個 AI 後端(如 llama.cpp、MLX、Sherpa-ONNX 和 ONNX Runtime)的統一介面。它會根據硬體(例如 Apple Silicon GPU、Windows ARM64 NPU)和模型格式自動選擇最佳可用引擎。使用者可從模型目錄或 Hugging Face GGUF 檔案中拉取模型,並透過簡單的 CLI 命令執行。對於託管模型,它與 RunAnywhere 控制台整合,提供計量式存取。
適用對象
專為開發者與高階使用者設計,希望從終端快速、注重隱私地執行 LLM 和其他 AI 模型,或希望將 AI 模型整合至 Claude Code、Claude Desktop 和 JetBrains IDE(CLion、RustRover)等編碼工具中的人群。
主要亮點
- 多模態支援:支援 LLM、視覺-語言模型(VLM)、文字轉語音(TTS)、語音轉文字(STT)、嵌入與影像生成。
- 混合本地/雲端:透過單一 CLI 命令,無縫在本地執行與託管模型之間切換。
- 硬體特定優化:利用 Apple 的 Metal/MLX 和高通的 Hexagon NPU 等專用硬體。
- 工具整合:一鍵命令即可將模型接入主流編碼代理與 IDE。
- OpenAI 兼容 API:可將模型作為本地 HTTP 端點提供給其他應用程式。
相關
- 專案
- 專案
- 專案
- 專案