zhongkaifu/TensorSharp

A native .NET LLM inference engine for GGUF models. TensorSharp provides a console application, a web-based chatbot interface, and Ollama/OpenAI-compatible HTTP APIs for programmatic access. It supports Windows/MacOS/Linux with full GPU capability

解決する課題

TensorSharp は、GGUF 形式の大規模言語モデル(LLM)およびマルチモーダルモデルを実行するために設計された、ネイティブな .NET 推論エンジンです。llama.cpp のような C++ ベースのエンジンに代わる高性能な選択肢を提供し、.NET 開発者が重い外部依存関係に頼ることなく、さまざまなハードウェアバックエンドでネイティブなパフォーマンスを発揮して AI モデルを展開できるようにします。

仕組み

このエンジンは、GGML(Metal、CUDA、Vulkan)、直接的な CUDA/cuBLAS パス、Apple Silicon 向けの MLX、および純粋な C# による CPU パスを含む幅広い計算バックエンドを実装しています。連続バッチ処理、ページング KV キャッシュ(vLLM スタイル)、推測デコードなどの高度な最適化手法を活用して、スループットを向上させ、レイテンシを削減します。非常に大規模なモデルについては、テンソル並列処理と分散クラスタリングをサポートしており、TCP 経由で単一のモデルを複数の GPU や複数のマシンに分割できます。

対象者

主に、マルチモーダル LLM をローカルで、または OpenAI 互換の API を備えたサーバーとして実行したいと考えている .NET 開発者や AI エンジニア、およびモデル推論の高性能なネイティブ .NET 実装を求めている開発者向けです。

ハイライト

  • マルチモーダル機能: 自己回帰型 LLM、DiffusionGemma テキスト拡散、画像編集用の Qwen-Image-Edit、および音声と動画の同時生成用の MiniMax-H3 をサポートしています。
  • 高性能: 純粋な .NET を使用して、特定のワークロード(例: Gemma 4 E4B)において llama.cpp と同等以上のパフォーマンスを発揮します。
  • 高度なスケーリング: テンソル並列処理(--tp)とノード間の分散推論のためのピアツーピア TCP クラスタリングを備えています。
  • 推測デコード: MTP を保持する GGUF や n-gram マッチングなど、トークン生成を加速するための 4 つの異なるアルゴリズムが含まれています。
  • 柔軟なデプロイ: コンソールアプリケーション、ブラウザベースのチャット UI、および Ollama/OpenAI 互換の HTTP API を提供します。
  • 幅広いハードウェアサポート: NVIDIA(CUDA)、Apple Silicon(Metal/MLX)、および Vulkan を介したさまざまな GPU で実行でき、純粋な C# による CPU フォールバックも備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト