zhongkaifu/TensorSharp
A native .NET LLM inference engine for GGUF models. TensorSharp provides a console application, a web-based chatbot interface, and Ollama/OpenAI-compatible HTTP APIs for programmatic access. It supports Windows/MacOS/Linux with full GPU capability
解決する課題
TensorSharp は、GGUF 形式の大規模言語モデル(LLM)およびマルチモーダルモデルを実行するために設計された、ネイティブな .NET 推論エンジンです。llama.cpp のような C++ ベースのエンジンに代わる高性能な選択肢を提供し、.NET 開発者が重い外部依存関係に頼ることなく、さまざまなハードウェアバックエンドでネイティブなパフォーマンスを発揮して AI モデルを展開できるようにします。
仕組み
このエンジンは、GGML(Metal、CUDA、Vulkan)、直接的な CUDA/cuBLAS パス、Apple Silicon 向けの MLX、および純粋な C# による CPU パスを含む幅広い計算バックエンドを実装しています。連続バッチ処理、ページング KV キャッシュ(vLLM スタイル)、推測デコードなどの高度な最適化手法を活用して、スループットを向上させ、レイテンシを削減します。非常に大規模なモデルについては、テンソル並列処理と分散クラスタリングをサポートしており、TCP 経由で単一のモデルを複数の GPU や複数のマシンに分割できます。
対象者
主に、マルチモーダル LLM をローカルで、または OpenAI 互換の API を備えたサーバーとして実行したいと考えている .NET 開発者や AI エンジニア、およびモデル推論の高性能なネイティブ .NET 実装を求めている開発者向けです。
ハイライト
- マルチモーダル機能: 自己回帰型 LLM、DiffusionGemma テキスト拡散、画像編集用の Qwen-Image-Edit、および音声と動画の同時生成用の MiniMax-H3 をサポートしています。
- 高性能: 純粋な .NET を使用して、特定のワークロード(例: Gemma 4 E4B)において
llama.cppと同等以上のパフォーマンスを発揮します。 - 高度なスケーリング: テンソル並列処理(
--tp)とノード間の分散推論のためのピアツーピア TCP クラスタリングを備えています。 - 推測デコード: MTP を保持する GGUF や n-gram マッチングなど、トークン生成を加速するための 4 つの異なるアルゴリズムが含まれています。
- 柔軟なデプロイ: コンソールアプリケーション、ブラウザベースのチャット UI、および Ollama/OpenAI 互換の HTTP API を提供します。
- 幅広いハードウェアサポート: NVIDIA(CUDA)、Apple Silicon(Metal/MLX)、および Vulkan を介したさまざまな GPU で実行でき、純粋な C# による CPU フォールバックも備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト