Michael-A-Kuykendall/shimmy

⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.

解決する課題

Shimmy は、ユーザーがローカルかつプライベートに GGUF モデルを実行できる、軽量な単一バイナリの推論サーバーを提供します。Python ランタイムや C++ ツールチェーンなどの重い依存関係の必要性を排除し、Ollama のようなツールに代わる、高速起動で低メモリな選択肢を提供します。

仕組み

Shimmy は OpenAI 互換の API サーバーとして機能します。Airframe エンジンを使用します。これは純粋な Rust 製のトランスフォーマーエンジンであり、WebGPU (WGSL) コンピュートシェーダーを活用して、さまざまな GPU(NVIDIA、AMD、Intel、Apple Silicon)上でモデルを実行します。GGUF メタデータからモデル仕様を自動的に導き出し、F32 累積精度を通じて決定論的な出力を保証します。

対象者

OpenAI SDK サーフェスを介して既存の AI ツールとシームレスに統合される、最小限で高性能なローカル LLM サーバーを求める開発者やユーザー向けに設計されています。

ハイライト

  • OpenAI 互換性: チャット補完、テキスト補完、ストリーミングをサポートしています。
  • 純粋な Rust: 依存関係ゼロの 100% Rust 実装で、起動時間は 1 秒未満です。
  • WebGPU アクセラレーション: WGSL コンピュートシェーダーによるクロスプラットフォーム GPU サポート。
  • TurboShimmy: VRAM 使用量を大幅に削減する INT4 KV キャッシュ圧縮機能。
  • 認定モデル: サポートされているモデルと量子化の組み合わせに対する厳格な 3 つの認証レジメン(MATH、INFERENCE、DETERMINISM)。
  • 拡張コンテキスト: コンテキストウィンドウを拡張するための YaRN RoPE スケーリングをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト