zhongkaifu/TensorSharp

A native .NET LLM inference engine for GGUF models. TensorSharp provides a console application, a web-based chatbot interface, and Ollama/OpenAI-compatible HTTP APIs for programmatic access. It supports Windows/MacOS/Linux with full GPU capability

解決的問題

TensorSharp 是一個原生的 .NET 推理引擎,旨在執行 GGUF 格式的大型語言模型(LLM)與多模態模型。它為 llama.cpp 等基於 C++ 的引擎提供了高效能的替代方案,讓 .NET 開發人員能夠在各種硬體後端上以原生效能部署 AI 模型,而無需依賴龐大的外部相依套件。

運作方式

該引擎實作了多種運算後端,包括 GGML(Metal、CUDA、Vulkan)、直接的 CUDA/cuBLAS 路徑、適用於 Apple Silicon 的 MLX,以及純 C# 的 CPU 路徑。它利用了先進的最佳化技術,例如連續批次處理、分頁 KV 快取(vLLM 風格)和推測解碼,以提高吞吐量並降低延遲。對於非常大的模型,它支援張量平行和分散式叢集,能夠透過 TCP 將單一模型拆分到多個 GPU 或多台機器上。

適用對象

它主要適用於希望在本地端或作為具有 OpenAI 相容 API 的伺服器來執行多模態 LLM 的 .NET 開發人員與 AI 工程師,以及尋求高效能、原生 .NET 模型推理實作的開發者。

亮點

  • 多模態能力:支援自回歸 LLM、DiffusionGemma 文字擴散、用於影像編輯的 Qwen-Image-Edit,以及用於聯合音訊視訊生成的 MiniMax-H3。
  • 高效能:使用純 .NET 在特定工作負載(例如 Gemma 4 E4B)上達到或超越 llama.cpp 的效能。
  • 進階擴充性:具備張量平行(--tp)和點對點 TCP 叢集功能,可用於跨節點的分散式推理。
  • 推測解碼:包含四種不同的演算法來加速 Token 生成,包括保留 MTP 的 GGUF 和 n-gram 比對。
  • 靈活部署:隨附於主控台應用程式、基於瀏覽器的聊天 UI,以及 Ollama/OpenAI 相容的 HTTP API。
  • 廣泛硬體支援:可在 NVIDIA(CUDA)、Apple Silicon(Metal/MLX)以及透過 Vulkan 的各種 GPU 上執行,並具備純 C# 的 CPU 後備方案。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案