lemonade-sdk/lemonade

Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk

解決的問題

Lemonade 提供了一種在使用者自己的硬體(CPU、GPU 與 NPU)上本地執行強大 AI 模型的方法,而不是依賴昂貴且侵犯隱私的雲端 API。透過針對主機 PC 的特定硬體進行自動優化,它簡化了多模態 AI(包括文本、圖像、語音與 3D 生成)的部署。

工作原理

Lemonade 以兩種主要模式運作:

  1. Lemonade Server:一個本地服務,公開標準的 OpenAI、Anthropic 與 Ollama API,允許使用者將現有的 AI 應用程式連接到其本地硬體。
  2. Embeddable Lemonade:一種可攜式二進位檔案,開發人員可以直接將其封裝到自己的軟體中,無需使用者安裝單獨的伺服器即可提供內建的本地 AI 功能。

它支援廣泛的模型格式(GGUF、FLM、ONNX),並利用跨多個後端(包括 NVIDIA CUDA、AMD ROCm、Vulkan、Metal 與 XDNA2 NPU)的各種推論引擎(如 llama.cpp 與 whisper.cpp)。

適用對象

  • 希望在聊天、編程與內容生成中使用免費、私密且本地 AI 的終端使用者
  • 希望將多模態 AI 作為可攜式、自動優化二進位檔案整合到其應用程式中的軟體開發人員
  • 希望最大限度發揮 Ryzen AI、Radeon 與 Strix Halo 系統效能的 AMD 硬體擁有者

亮點

  • 多模態支援:處理文本生成、語音轉文字、文字轉語音、圖像生成以及實驗性的 3D 生成。
  • 廣泛的硬體相容性:針對 NVIDIA GPU、AMD GPU/NPU、Apple Silicon 與標準 CPU 進行了優化。
  • API 相容性:可與任何與 OpenAI 相容的用戶端函式庫配合使用。
  • 模型管理:內建模型管理器,可從 Hugging Face 與 ModelScope 等來源瀏覽並下載模型。