lemonade-sdk/lemonade
Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk
解决的问题
Lemonade 提供了一种在用户自己的硬件(CPU、GPU 和 NPU)上本地运行强大 AI 模型的方法,而不是依赖昂贵且侵犯隐私的云端 API。通过针对主机 PC 的特定硬件进行自动优化,它简化了多模态 AI(包括文本、图像、语音和 3D 生成)的部署。
工作原理
Lemonade 以两种主要模式运行:
- Lemonade Server:一个本地服务,公开标准的 OpenAI、Anthropic 和 Ollama API,允许用户将现有的 AI 应用程序连接到其本地硬件。
- Embeddable Lemonade:一种便携式二进制文件,开发人员可以直接将其打包到自己的软件中,无需用户安装单独的服务器即可提供内置的本地 AI 功能。
它支持广泛的模型格式(GGUF、FLM、ONNX),并利用跨多个后端(包括 NVIDIA CUDA、AMD ROCm、Vulkan、Metal 和 XDNA2 NPU)的各种推理引擎(如 llama.cpp 和 whisper.cpp)。
适用对象
- 希望在聊天、编程和内容生成中使用免费、私密且本地 AI 的终端用户。
- 希望将多模态 AI 作为便携式、自动优化二进制文件集成到其应用程序中的软件开发人员。
- 希望最大限度提高 Ryzen AI、Radeon 和 Strix Halo 系统性能的 AMD 硬件所有者。
亮点
- 多模态支持:处理文本生成、语音转文本、文本转语音、图像生成以及实验性的 3D 生成。
- 广泛的硬件兼容性:针对 NVIDIA GPU、AMD GPU/NPU、Apple Silicon 和标准 CPU 进行了优化。
- API 兼容性:可与任何与 OpenAI 兼容的客户端库配合使用。
- 模型管理:内置模型管理器,可从 Hugging Face 和 ModelScope 等来源浏览并下载模型。