NotPunchnox/rkllama

Ollama alternative for Rockchip NPU: An efficient solution for running AI and Deep learning models on Rockchip devices with optimized NPU support ( rkllm )

何を解決するか

RKLLamaは、Rockchip RK3588(S)およびRK3576プラットフォームに特化して最適化された大規模言語モデル(LLM)およびその他のAIモデルを実行する方法を提供します。OllamaやLlama.cppのような汎用ツールとは異なり、RKLLamaはこれらのモデルをNPU(ニューラルプロセッシングユニット)上で直接実行可能にし、この特定のハードウェア上で大幅なパフォーマンス向上を実現します。

動作方法

サーバー・クライアントアーキテクチャとして動作します。サーバーはrkllm-runtimeおよびrknn-runtimeライブラリを使用して.rkllmおよび.rknnモデルの読み込みと実行を処理します。Ollamaと部分的にOpenAI APIに互換性のあるREST APIを提供し、標準的なAPI呼び出しまたは提供されたPythonクライアントを通じてモデルと対話できます。システムは動的モデルの読み込み/アンロード、高速なコンテキスト切り替えのためのプロンプトキャッシュ、および対応するRockchipプラットフォームのCPU自動検出をサポートしています。

対象ユーザー

Orange Pi 5シリーズやRadxa Rock 4dなどのRockchip搭載のシングルボードコンピュータを使用し、NPUアクセラレーションを活用してローカルAIモデル(テキスト、ビジョン、画像生成、音声処理など)を実行したい開発者やハッカー向けです。

特徴

  • NPUアクセラレーション:CPU/GPUではなくNPU上でモデルを実行します。
  • 広範なAPI互換性:Ollamaおよび部分的なOpenAI APIエンドポイント(チャット、コンプリーション、埋め込み、マルチモーダルタスク)をサポートします。
  • マルチモーダル機能:ビジョンモデル(例:Qwen2VL)による画像質問、画像生成(Stable Diffusion)、音声認識/音声合成(Whisper、Piper、MMS-TTS)をサポートします。
  • 高度なLLM機能:QwenやLlama 3.2+などのモデルにおけるツール/関数呼び出し機能をサポートします。
  • 効率的なメモリ管理:動的モデル読み込み、非アクティブモデルの自動アンロード、高速なセッション復元のためのプロンプトキャッシュ保存を実装しています。
  • GGUFサポート:特定のllama.cppフォークを介して.GGUFモデルのNPU推論を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト