NotPunchnox/rkllama
Ollama alternative for Rockchip NPU: An efficient solution for running AI and Deep learning models on Rockchip devices with optimized NPU support ( rkllm )
解决的问题
RKLLama 为 Rockchip RK3588(S) 和 RK3576 平台量身定制的大规模语言模型(LLM)及其他 AI 模型提供运行方案。与 Ollama 或 Llama.cpp 等通用工具不同,RKLLama 使这些模型能够直接在 NPU(神经网络处理单元)上运行,显著提升该特定硬件上的性能表现。
工作原理
采用服务器-客户端架构。服务器使用 rkllm-runtime 和 rknn-runtime 库加载并执行 .rkllm 和 .rknn 模型。提供与 Ollama 兼容、部分兼容 OpenAI 的 REST API,用户可通过标准 API 调用或提供的 Python 客户端与模型交互。系统支持动态模型加载/卸载、快速上下文切换的提示缓存,以及对支持的 Rockchip 平台的 CPU 自动检测功能。
适用人群
使用 Orange Pi 5 系列或 Radxa Rock 4d 等 Rockchip 单板计算机的开发者和爱好者,希望在 NPU 加速下运行本地 AI 模型,涵盖文本、视觉、图像生成和语音任务。
核心亮点
- NPU 加速:模型在 NPU 上运行,而非仅依赖 CPU/GPU。
- 广泛 API 兼容性:支持 Ollama 和部分 OpenAI API 端点,适用于聊天、补全、嵌入和多模态任务。
- 多模态能力:支持视觉模型(如 Qwen2VL)进行图像问答、Stable Diffusion 图像生成,以及 Whisper、Piper、MMS-TTS 的语音转文本/文本转语音。
- 高级 LLM 功能:支持 Qwen 和 Llama 3.2+ 等模型的工具/函数调用功能。
- 高效内存管理:支持动态模型加载、非活跃模型自动卸载,以及提示缓存保存以实现快速会话恢复。
- GGUF 支持:通过特定的 llama.cpp 分支,实现
.GGUF模型的 NPU 推理。
相关
- 项目
- 项目
- 项目
- 项目