brontoguana/krasis
Krasis is a Hybrid LLM runtime which focuses on efficient running of larger models on consumer grade VRAM limited hardware
解決する課題
Krasisを使用すると、コンシューマー向けNVIDIA GPUで数千億のパラメータを持つ大規模なMixture-of-Experts (MoE)モデルを実行できます。システムRAMとVRAM間でモデルの重みがどのように保存および移動されるかを管理することで、これらのモデルが標準的なGPU VRAMに収まらない大きさであるという問題を解決します。
仕組み
Krasisは、RustとCUDAで記述された高性能ランタイムを使用して、モデルの実行を調整します。メモリフットプリントを削減し、速度を向上させるために、いくつかの主要なテクノロジーを採用しています:
- HCSエキスパート常駐管理: 「ホット」および「コールド」エキスパートを動的に管理し、VRAMとCPU RAM間で移動させることで、利用可能なVRAMを超えるモデルでも機能できるようにします。
- 量子化: キャッシュされたINT4/INT8エキスパートフォーマットとHQQアテンションキャッシュを構築し、モデルの重みを圧縮します。
- コンパクトなKVキャッシング: 特殊なモード(
k6v6やk4v4など)を提供し、Key-Valueキャッシュが使用するメモリを削減します。 - GPUアクセラレーテッド処理: 高速なプロンプト処理のためにフルGPUプリフィルを使用し、GPU実行デコードを行います。
対象者
NVIDIA GPU(Ampereアーキテクチャ以降)を持ち、エンタープライズ級のハードウェアを必要とせずに最先端の大規模MoEモデルをローカルで実行したい開発者やAI愛好家向けに設計されています。
ハイライト
- 幅広いモデルサポート: DeepSeek-V4、Qwen3、Gemma 4、Nemotron MoEなどのファミリーについて検証済みです。
- OpenAI互換性: OpenAI互換のAPIを提供し、ネイティブモデルのツール呼び出し構文を構造化された
tool_callsに変換します。 - Krasis Manager: GPU VRAMの使用状況を監視し、JSON APIを介してモデル設定を管理するための、Rustベースのダッシュボード。
- クロスプラットフォーム: Windows用のネイティブインストーラーと、Linux/WSL2のサポート。
- パフォーマンスツール: 組み込みの再現可能なベンチマークと専用のチャットクライアントが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト