NotPunchnox/rkllama
Ollama alternative for Rockchip NPU: An efficient solution for running AI and Deep learning models on Rockchip devices with optimized NPU support ( rkllm )
해결하는 문제
RKLLama는 Rockchip RK3588(S) 및 RK3576 플랫폼에 특화된 대규모 언어 모델(LLM)과 기타 AI 모델을 실행할 수 있는 방법을 제공합니다. 일반적인 도구인 Ollama나 Llama.cpp와 달리, RKLLama는 이러한 모델을 NPU(신경처리장치)에서 직접 실행할 수 있게 하여 이 특정 하드웨어에서 성능을 크게 향상시킵니다.
작동 방식
서버-클라이언트 아키텍처로 작동합니다. 서버는 rkllm-runtime 및 rknn-runtime 라이브러리를 사용하여 .rkllm 및 .rknn 모델을 로드하고 실행합니다. Ollama와 부분적으로 호환되는 REST API를 제공하여 표준 API 호출 또는 제공된 Python 클라이언트를 통해 모델과 상호작용할 수 있습니다. 시스템은 동적 모델 로드/언로드, 빠른 컨텍스트 전환을 위한 프롬프트 캐시, 지원되는 Rockchip 플랫폼의 CPU 자동 감지 기능을 지원합니다.
대상 사용자
Orange Pi 5 시리즈 또는 Radxa Rock 4d와 같은 Rockchip 기반 싱글보드 컴퓨터를 사용하여 NPU 가속을 통해 로컬 AI 모델(텍스트, 비전, 이미지 생성, 음성 작업 등)을 실행하고자 하는 개발자 및 애호가들입니다.
주요 특징
- NPU 가속: CPU/GPU가 아닌 NPU에서 모델을 실행합니다.
- 광범위한 API 호환성: Ollama 및 부분적인 OpenAI API 엔드포인트(채팅, 완성, 임베딩, 멀티모달 작업)를 지원합니다.
- 멀티모달 기능: Qwen2VL과 같은 비전 모델을 사용한 이미지 질의, Stable Diffusion을 통한 이미지 생성, Whisper, Piper, MMS-TTS를 통한 음성-텍스트/텍스트-음성 변환을 지원합니다.
- 고급 LLM 기능: Qwen 및 Llama 3.2+와 같은 모델의 도구/함수 호출 기능을 지원합니다.
- 효율적인 메모리 관리: 동적 모델 로드, 비활성 모델 자동 언로드, 빠른 세션 복원을 위한 프롬프트 캐시 저장 기능을 제공합니다.
- GGUF 지원: 특정 llama.cpp 포크를 통해
.GGUF모델에 대한 NPU 추론을 가능하게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트