Michael-A-Kuykendall/shimmy

⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.

解决的问题

Shimmy 提供了一个轻量级的单一二进制文件推理服务器,允许用户在本地且私密地运行 GGUF 模型。它消除了对 Python 运行时或 C++ 工具链等繁重依赖项的需求,为 Ollama 等工具提供了快速启动、低内存占用的替代方案。

工作原理

Shimmy 充当兼容 OpenAI 的 API 服务器。它使用 Airframe 引擎——一个纯 Rust 的 Transformer 引擎,利用 WebGPU (WGSL) 计算着色器在各种 GPU(NVIDIA、AMD、Intel、Apple Silicon)上运行模型。它会自动从 GGUF 元数据中推导模型规格,并通过 F32 累加精度确保确定性的输出。

适用人群

专为想要极简、高性能本地 LLM 服务器的开发者和用户设计,能通过 OpenAI SDK 接口与现有的 AI 工具无缝集成。

亮点

  • 兼容 OpenAI:支持聊天补全、文本补全和流式传输。
  • 纯 Rust:100% Rust 实现,零依赖且启动时间 <1s。
  • WebGPU 加速:通过 WGSL 计算着色器提供跨平台 GPU 支持。
  • TurboShimmy:一项 INT4 KV 缓存压缩功能,可显著降低 VRAM 使用量。
  • 认证模型:对支持的模型与量化组合执行严格的 3 项认证程序(MATH、INFERENCE、DETERMINISM)。
  • 扩展上下文:支持 YaRN RoPE 缩放以扩展上下文窗口。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目