brontoguana/krasis
Krasis is a Hybrid LLM runtime which focuses on efficient running of larger models on consumer grade VRAM limited hardware
解决的问题
Krasis 允许用户在消费级 NVIDIA GPU 上运行庞大的混合专家模型——有些模型具有数百亿个参数。它通过管理模型权重在系统 RAM 和 VRAM 之间的存储和移动方式,解决了这些模型因太大而无法放入标准 GPU VRAM 的问题。
工作原理
Krasis 使用以 Rust 和 CUDA 编写的高性能运行时来协调模型执行。它采用了几项关键技术来减少内存占用并提高速度:
- HCS 专家驻留管理: 动态管理“热”和“冷”专家,在 VRAM 和 CPU RAM 之间移动它们,使大于可用 VRAM 的模型仍能运行。
- 量化: 构建缓存的 INT4/INT8 专家格式和 HQQ 注意力缓存,以压缩模型权重。
- 紧凑 KV 缓存: 提供专用模式(如
k6v6和k4v4)以减少键值缓存使用的内存。 - GPU 加速处理: 使用完整的 GPU 预填充进行快速提示处理,并由 GPU 执行解码。
适用人群
专为拥有 NVIDIA GPU(Ampere 架构及更新版本)的开发者和 AI 爱好者设计,他们希望无需企业级硬件即可在本地运行最先进的大规模 MoE 模型。
亮点
- 广泛的模型支持: 已验证的模型家族包括 DeepSeek-V4、Qwen3、Gemma 4 和 Nemotron MoE。
- OpenAI 兼容性: 提供 OpenAI 兼容的 API,并将原生模型工具调用语法转换为结构化的
tool_calls。 - Krasis Manager: 一个基于 Rust 的仪表板,用于监控 GPU VRAM 使用情况并通过 JSON API 管理模型配置。
- 跨平台: 提供 Windows 原生安装程序,并支持 Linux/WSL2。
- 性能工具: 包括内置的可重复基准测试和专用聊天客户端。
相关
- 项目
- 项目
- 项目
- 项目
- 项目