lemonade-sdk/lemonade

Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk

解决的问题

Lemonade 提供了一种在用户自己的硬件(CPU、GPU 和 NPU)上本地运行强大 AI 模型的方法,而不是依赖昂贵且侵犯隐私的云端 API。通过针对主机 PC 的特定硬件进行自动优化,它简化了多模态 AI(包括文本、图像、语音和 3D 生成)的部署。

工作原理

Lemonade 以两种主要模式运行:

  1. Lemonade Server:一个本地服务,公开标准的 OpenAI、Anthropic 和 Ollama API,允许用户将现有的 AI 应用程序连接到其本地硬件。
  2. Embeddable Lemonade:一种便携式二进制文件,开发人员可以直接将其打包到自己的软件中,无需用户安装单独的服务器即可提供内置的本地 AI 功能。

它支持广泛的模型格式(GGUF、FLM、ONNX),并利用跨多个后端(包括 NVIDIA CUDA、AMD ROCm、Vulkan、Metal 和 XDNA2 NPU)的各种推理引擎(如 llama.cpp 和 whisper.cpp)。

适用对象

  • 希望在聊天、编程和内容生成中使用免费、私密且本地 AI 的终端用户
  • 希望将多模态 AI 作为便携式、自动优化二进制文件集成到其应用程序中的软件开发人员
  • 希望最大限度提高 Ryzen AI、Radeon 和 Strix Halo 系统性能的 AMD 硬件所有者

亮点

  • 多模态支持:处理文本生成、语音转文本、文本转语音、图像生成以及实验性的 3D 生成。
  • 广泛的硬件兼容性:针对 NVIDIA GPU、AMD GPU/NPU、Apple Silicon 和标准 CPU 进行了优化。
  • API 兼容性:可与任何与 OpenAI 兼容的客户端库配合使用。
  • 模型管理:内置模型管理器,可从 Hugging Face 和 ModelScope 等来源浏览并下载模型。