brontoguana/krasis

Krasis is a Hybrid LLM runtime which focuses on efficient running of larger models on consumer grade VRAM limited hardware

解决的问题

Krasis 允许用户在消费级 NVIDIA GPU 上运行庞大的混合专家模型——有些模型具有数百亿个参数。它通过管理模型权重在系统 RAM 和 VRAM 之间的存储和移动方式,解决了这些模型因太大而无法放入标准 GPU VRAM 的问题。

工作原理

Krasis 使用以 Rust 和 CUDA 编写的高性能运行时来协调模型执行。它采用了几项关键技术来减少内存占用并提高速度:

  • HCS 专家驻留管理: 动态管理“热”和“冷”专家,在 VRAM 和 CPU RAM 之间移动它们,使大于可用 VRAM 的模型仍能运行。
  • 量化: 构建缓存的 INT4/INT8 专家格式和 HQQ 注意力缓存,以压缩模型权重。
  • 紧凑 KV 缓存: 提供专用模式(如 k6v6k4v4)以减少键值缓存使用的内存。
  • GPU 加速处理: 使用完整的 GPU 预填充进行快速提示处理,并由 GPU 执行解码。

适用人群

专为拥有 NVIDIA GPU(Ampere 架构及更新版本)的开发者和 AI 爱好者设计,他们希望无需企业级硬件即可在本地运行最先进的大规模 MoE 模型。

亮点

  • 广泛的模型支持: 已验证的模型家族包括 DeepSeek-V4、Qwen3、Gemma 4 和 Nemotron MoE。
  • OpenAI 兼容性: 提供 OpenAI 兼容的 API,并将原生模型工具调用语法转换为结构化的 tool_calls
  • Krasis Manager: 一个基于 Rust 的仪表板,用于监控 GPU VRAM 使用情况并通过 JSON API 管理模型配置。
  • 跨平台: 提供 Windows 原生安装程序,并支持 Linux/WSL2。
  • 性能工具: 包括内置的可重复基准测试和专用聊天客户端。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目