Michael-A-Kuykendall/shimmy
⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.
解決的問題
Shimmy 提供了一個輕量級的單一執行檔推論伺服器,讓使用者能在本地端且私密地執行 GGUF 模型。它消除了對 Python 執行環境或 C++ 工具鏈等笨重依賴的需求,為 Ollama 等工具提供了快速啟動、低記憶體佔用的替代方案。
運作原理
Shimmy 扮演相容於 OpenAI 的 API 伺服器。它使用 Airframe 引擎——一個純 Rust 的 Transformer 引擎,利用 WebGPU (WGSL) 運算著色器在各種 GPU(NVIDIA、AMD、Intel、Apple Silicon)上執行模型。它會自動從 GGUF 元資料中推導模型規格,並透過 F32 累加精度確保輸出的確定性。
適用對象
專為想要極簡、高效能本地 LLM 伺服器的開發者與使用者設計,能透過 OpenAI SDK 介面與現有的 AI 工具無縫整合。
特色
- 相容於 OpenAI:支援聊天補全、文字補全與串流功能。
- 純 Rust:100% Rust 實作,零依賴且啟動時間 <1s。
- WebGPU 加速:透過 WGSL 運算著色器提供跨平台 GPU 支援。
- TurboShimmy:一項 INT4 KV 快取壓縮功能,可大幅降低 VRAM 使用量。
- 認證模型:對支援的模型與量化組合執行嚴格的 3 項認證程序(MATH、INFERENCE、DETERMINISM)。
- 擴充上下文:支援 YaRN RoPE 縮放以擴充上下文視窗。
相關
- 專案
- 專案
- 專案
- 專案
- 專案