lemonade-sdk/lemonade
Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk
解決する課題
Lemonadeは、高価でプライバシーの侵害につながる可能性のあるクラウドAPIに頼る代わりに、ユーザー自身のハードウェア(CPU、GPU、NPU)上で強力なAIモデルをローカルで実行する方法を提供します。ホストPCの特定のハードウェアに合わせて自動的に最適化することで、テキスト、画像、音声、3D生成を含むマルチモーダルAIのデプロイを簡素化します。
仕組み
Lemonadeは主に2つのモードで動作します:
- Lemonade Server: 標準的なOpenAI、Anthropic、Ollama APIを公開するローカルサービスであり、ユーザーが既存のAIアプリケーションをローカルハードウェアに接続できるようにします。
- Embeddable Lemonade: 開発者が自身のソフトウェアに直接パッケージ化できるポータブルなバイナリであり、ユーザーに個別のサーバーのインストールを要求することなく、組み込みのローカルAI機能を提供します。
NVIDIA CUDA、AMD ROCm、Vulkan、Metal、XDNA2 NPUを含む複数のバックエンドにわたって、幅広いモデル形式(GGUF, FLM, ONNX)をサポートし、さまざまな推論エンジン(llama.cppやwhisper.cppなど)を活用します。
対象ユーザー
- チャット、コーディング、コンテンツ生成のために、無料でプライベートなローカルAIを求めるエンドユーザー。
- マルチモーダルAIを、ポータブルで自動最適化されたバイナリとしてアプリケーションに統合したいソフトウェア開発者。
- Ryzen AI、Radeon、Strix Haloシステムのパフォーマンスを最大限に引き出したいAMDハードウェア所有者。
ハイライト
- マルチモーダル対応: テキスト生成、音声文字起こし、テキスト読み上げ、画像生成、および実験的な3D生成に対応。
- 幅広いハードウェア互換性: NVIDIA GPU、AMD GPU/NPU、Apple Silicon、および標準的なCPU向けに最適化。
- API互換性: すべてのOpenAI互換クライアントライブラリで使用可能。
- モデル管理: Hugging FaceやModelScopeなどのソースからモデルを閲覧・ダウンロードできる組み込みのModel Managerを搭載。