Michael-A-Kuykendall/shimmy
⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.
解決する課題
Shimmy は、ユーザーがローカルかつプライベートに GGUF モデルを実行できる、軽量な単一バイナリの推論サーバーを提供します。Python ランタイムや C++ ツールチェーンなどの重い依存関係の必要性を排除し、Ollama のようなツールに代わる、高速起動で低メモリな選択肢を提供します。
仕組み
Shimmy は OpenAI 互換の API サーバーとして機能します。Airframe エンジンを使用します。これは純粋な Rust 製のトランスフォーマーエンジンであり、WebGPU (WGSL) コンピュートシェーダーを活用して、さまざまな GPU(NVIDIA、AMD、Intel、Apple Silicon)上でモデルを実行します。GGUF メタデータからモデル仕様を自動的に導き出し、F32 累積精度を通じて決定論的な出力を保証します。
対象者
OpenAI SDK サーフェスを介して既存の AI ツールとシームレスに統合される、最小限で高性能なローカル LLM サーバーを求める開発者やユーザー向けに設計されています。
ハイライト
- OpenAI 互換性: チャット補完、テキスト補完、ストリーミングをサポートしています。
- 純粋な Rust: 依存関係ゼロの 100% Rust 実装で、起動時間は 1 秒未満です。
- WebGPU アクセラレーション: WGSL コンピュートシェーダーによるクロスプラットフォーム GPU サポート。
- TurboShimmy: VRAM 使用量を大幅に削減する INT4 KV キャッシュ圧縮機能。
- 認定モデル: サポートされているモデルと量子化の組み合わせに対する厳格な 3 つの認証レジメン(MATH、INFERENCE、DETERMINISM)。
- 拡張コンテキスト: コンテキストウィンドウを拡張するための YaRN RoPE スケーリングをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト