Michael-A-Kuykendall/shimmy

⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.

解決的問題

Shimmy 提供了一個輕量級的單一執行檔推論伺服器,讓使用者能在本地端且私密地執行 GGUF 模型。它消除了對 Python 執行環境或 C++ 工具鏈等笨重依賴的需求,為 Ollama 等工具提供了快速啟動、低記憶體佔用的替代方案。

運作原理

Shimmy 扮演相容於 OpenAI 的 API 伺服器。它使用 Airframe 引擎——一個純 Rust 的 Transformer 引擎,利用 WebGPU (WGSL) 運算著色器在各種 GPU(NVIDIA、AMD、Intel、Apple Silicon)上執行模型。它會自動從 GGUF 元資料中推導模型規格,並透過 F32 累加精度確保輸出的確定性。

適用對象

專為想要極簡、高效能本地 LLM 伺服器的開發者與使用者設計,能透過 OpenAI SDK 介面與現有的 AI 工具無縫整合。

特色

  • 相容於 OpenAI:支援聊天補全、文字補全與串流功能。
  • 純 Rust:100% Rust 實作,零依賴且啟動時間 <1s。
  • WebGPU 加速:透過 WGSL 運算著色器提供跨平台 GPU 支援。
  • TurboShimmy:一項 INT4 KV 快取壓縮功能,可大幅降低 VRAM 使用量。
  • 認證模型:對支援的模型與量化組合執行嚴格的 3 項認證程序(MATH、INFERENCE、DETERMINISM)。
  • 擴充上下文:支援 YaRN RoPE 縮放以擴充上下文視窗。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案