brontoguana/krasis

Krasis is a Hybrid LLM runtime which focuses on efficient running of larger models on consumer grade VRAM limited hardware

解決的問題

Krasis 讓使用者能夠在消費級 NVIDIA GPU 上運行龐大的混合專家模型——有些模型具有數百億個參數。它透過管理模型權重在系統 RAM 和 VRAM 之間的儲存與移動方式,解決了這些模型因太大而無法放入標準 GPU VRAM 的問題。

運作原理

Krasis 使用以 Rust 和 CUDA 編寫的高效能執行階段來協調模型執行。它採用多項關鍵技術來減少記憶體佔用並提升速度:

  • HCS 專家駐留管理: 動態管理「熱」和「冷」專家,在 VRAM 和 CPU RAM 之間移動它們,讓大於可用 VRAM 的模型仍能運作。
  • 量化: 建立快取的 INT4/INT8 專家格式和 HQQ 注意力快取,以壓縮模型權重。
  • 精簡 KV 快取: 提供專門的模式(如 k6v6k4v4)以減少鍵值快取使用的記憶體。
  • GPU 加速處理: 使用完整的 GPU 預填來進行快速提示詞處理,並由 GPU 執行解碼。

適用對象

專為擁有 NVIDIA GPU(Ampere 架構及更新版本)的開發者和 AI 愛好者設計,讓他們能在本地運行最先進的大規模 MoE 模型,而無需企業級硬體。

亮點

  • 廣泛的模型支援: 已驗證的模型家族包括 DeepSeek-V4、Qwen3、Gemma 4 和 Nemotron MoE。
  • OpenAI 相容性: 提供 OpenAI 相容的 API,並將原生模型工具呼叫語法轉換為結構化的 tool_calls
  • Krasis Manager: 一個基於 Rust 的儀表板,用於監控 GPU VRAM 使用量並透過 JSON API 管理模型設定。
  • 跨平台: 提供 Windows 原生安裝程式,並支援 Linux/WSL2。
  • 效能工具: 包含內建的可重複基準測試和專用的聊天用戶端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案