lemonade-sdk/lemonade

Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk

해결하는 문제

Lemonade는 비용이 많이 들고 개인정보 침해 우려가 있는 클라우드 API에 의존하는 대신, 사용자의 자체 하드웨어(CPU, GPU, NPU)에서 강력한 AI 모델을 로컬로 실행할 수 있는 방법을 제공합니다. 호스트 PC의 특정 하드웨어에 맞춰 자동으로 최적화함으로써 텍스트, 이미지, 음성 및 3D 생성을 포함한 멀티모달 AI 배포를 단순화합니다.

작동 방식

Lemonade는 두 가지 주요 모드로 작동합니다:

  1. Lemonade Server: 표준 OpenAI, Anthropic, Ollama API를 노출하는 로컬 서비스로, 사용자가 기존 AI 애플리케이션을 로컬 하드웨어에 연결할 수 있도록 합니다.
  2. Embeddable Lemonade: 개발자가 자신의 소프트웨어에 직접 패키징할 수 있는 휴대용 바이너리로, 사용자가 별도의 서버를 설치할 필요 없이 내장된 로컬 AI 기능을 제공합니다.

NVIDIA CUDA, AMD ROCm, Vulkan, Metal, XDNA2 NPU를 포함한 다양한 백엔드에서 다양한 추론 엔진(llama.cpp 및 whisper.cpp 등)을 활용하며 광범위한 모델 형식(GGUF, FLM, ONNX)을 지원합니다.

대상 사용자

  • 채팅, 코딩 및 콘텐츠 생성을 위해 무료로 프라이빗한 로컬 AI를 원하는 최종 사용자.
  • 멀티모달 AI를 휴대용 자동 최적화 바이너리로 애플리케이션에 통합하려는 소프트웨어 개발자.
  • Ryzen AI, Radeon, Strix Halo 시스템의 성능을 극대화하려는 AMD 하드웨어 소유자.

주요 특징

  • 멀티모달 지원: 텍스트 생성, 음성-텍스트 변환, 텍스트-음성 변환, 이미지 생성 및 실험적인 3D 생성을 처리합니다.
  • 폭넓은 하드웨어 호환성: NVIDIA GPU, AMD GPU/NPU, Apple Silicon 및 표준 CPU에 최적화되었습니다.
  • API 호환성: 모든 OpenAI 호환 클라이언트 라이브러리와 함께 작동합니다.
  • 모델 관리: Hugging Face 및 ModelScope와 같은 소스에서 모델을 찾아보고 다운로드할 수 있는 내장 모델 관리자를 포함합니다.