NotPunchnox/rkllama

Ollama alternative for Rockchip NPU: An efficient solution for running AI and Deep learning models on Rockchip devices with optimized NPU support ( rkllm )

解決的問題

RKLLama 為 Rockchip RK3588(S) 與 RK3576 平台量身打造的大規模語言模型(LLM)及其他 AI 模型提供運行方案。與 Ollama 或 Llama.cpp 等通用工具不同,RKLLama 讓這些模型能直接在 NPU(神經處理單元)上執行,顯著提升此特定硬體上的效能表現。

工作原理

採用伺服器-客戶端架構。伺服器使用 rkllm-runtimerknn-runtime 庫載入並執行 .rkllm.rknn 模型。提供與 Ollama 相容、部分相容 OpenAI 的 REST API,使用者可透過標準 API 呼叫或提供的 Python 客戶端與模型互動。系統支援動態模型載入/卸載、快速上下文切換的提示快取,以及對支援的 Rockchip 平台的 CPU 自動偵測功能。

適用對象

使用 Orange Pi 5 系列或 Radxa Rock 4d 等 Rockchip 電子單板電腦的開發者與愛好者,希望在 NPU 加速下執行本地 AI 模型,涵蓋文字、視覺、影像生成與語音任務。

核心亮點

  • NPU 加速:模型在 NPU 上執行,而非僅依賴 CPU/GPU。
  • 廣泛 API 相容性:支援 Ollama 與部分 OpenAI API 端點,適用於聊天、補全、嵌入與多模態任務。
  • 多模態能力:支援視覺模型(如 Qwen2VL)進行影像提問、Stable Diffusion 影像生成,以及 Whisper、Piper、MMS-TTS 的語音轉文字/文字轉語音。
  • 進階 LLM 功能:支援 Qwen 與 Llama 3.2+ 等模型的工具/函數呼叫功能。
  • 高效記憶體管理:支援動態模型載入、非活躍模型自動卸載,以及提示快取儲存以實現快速會話復原。
  • GGUF 支援:透過特定的 llama.cpp 分支,實現 .GGUF 模型的 NPU 推理。

相關

  • 專案
  • 專案
  • 專案
  • 專案