NotPunchnox/rkllama
Ollama alternative for Rockchip NPU: An efficient solution for running AI and Deep learning models on Rockchip devices with optimized NPU support ( rkllm )
解決的問題
RKLLama 為 Rockchip RK3588(S) 與 RK3576 平台量身打造的大規模語言模型(LLM)及其他 AI 模型提供運行方案。與 Ollama 或 Llama.cpp 等通用工具不同,RKLLama 讓這些模型能直接在 NPU(神經處理單元)上執行,顯著提升此特定硬體上的效能表現。
工作原理
採用伺服器-客戶端架構。伺服器使用 rkllm-runtime 與 rknn-runtime 庫載入並執行 .rkllm 與 .rknn 模型。提供與 Ollama 相容、部分相容 OpenAI 的 REST API,使用者可透過標準 API 呼叫或提供的 Python 客戶端與模型互動。系統支援動態模型載入/卸載、快速上下文切換的提示快取,以及對支援的 Rockchip 平台的 CPU 自動偵測功能。
適用對象
使用 Orange Pi 5 系列或 Radxa Rock 4d 等 Rockchip 電子單板電腦的開發者與愛好者,希望在 NPU 加速下執行本地 AI 模型,涵蓋文字、視覺、影像生成與語音任務。
核心亮點
- NPU 加速:模型在 NPU 上執行,而非僅依賴 CPU/GPU。
- 廣泛 API 相容性:支援 Ollama 與部分 OpenAI API 端點,適用於聊天、補全、嵌入與多模態任務。
- 多模態能力:支援視覺模型(如 Qwen2VL)進行影像提問、Stable Diffusion 影像生成,以及 Whisper、Piper、MMS-TTS 的語音轉文字/文字轉語音。
- 進階 LLM 功能:支援 Qwen 與 Llama 3.2+ 等模型的工具/函數呼叫功能。
- 高效記憶體管理:支援動態模型載入、非活躍模型自動卸載,以及提示快取儲存以實現快速會話復原。
- GGUF 支援:透過特定的 llama.cpp 分支,實現
.GGUF模型的 NPU 推理。
相關
- 專案
- 專案
- 專案
- 專案