zhongkaifu/TensorSharp
A native .NET LLM inference engine for GGUF models. TensorSharp provides a console application, a web-based chatbot interface, and Ollama/OpenAI-compatible HTTP APIs for programmatic access. It supports Windows/MacOS/Linux with full GPU capability
解决的问题
TensorSharp 是一个原生的 .NET 推理引擎,旨在运行 GGUF 格式的大型语言模型(LLM)和多模态模型。它为 llama.cpp 等基于 C++ 的引擎提供了高性能的替代方案,使 .NET 开发人员能够在各种硬件后端上以原生性能部署 AI 模型,而无需依赖庞大的外部依赖项。
工作原理
该引擎实现了广泛的计算后端,包括 GGML(Metal、CUDA、Vulkan)、直接的 CUDA/cuBLAS 路径、适用于 Apple Silicon 的 MLX,以及纯 C# 的 CPU 路径。它利用了先进的优化技术,例如连续批处理、分页 KV 缓存(vLLM 风格)和推测解码,以提高吞吐量并降低延迟。对于非常大的模型,它支持张量并行和分布式集群,能够通过 TCP 将单个模型拆分到多个 GPU 或多台机器上。
适用人群
它主要面向希望在本地或作为具有 OpenAI 兼容 API 的服务器来运行多模态 LLM 的 .NET 开发人员和 AI 工程师,以及寻求高性能、原生 .NET 模型推理实现的开发者。
亮点
- 多模态功能:支持自回归 LLM、DiffusionGemma 文本扩散、用于图像编辑的 Qwen-Image-Edit,以及用于联合音视频生成的 MiniMax-H3。
- 高性能:使用纯 .NET 在特定工作负载(例如 Gemma 4 E4B)上达到或超越
llama.cpp的性能。 - 高级扩展性:具备张量并行(
--tp)和点对点 TCP 集群功能,可用于跨节点的分布式推理。 - 推测解码:包含四种不同的算法来加速 Token 生成,包括保留 MTP 的 GGUF 和 n-gram 匹配。
- 灵活部署:附带控制台应用程序、基于浏览器的聊天 UI,以及 Ollama/OpenAI 兼容的 HTTP API。
- 广泛的硬件支持:可在 NVIDIA(CUDA)、Apple Silicon(Metal/MLX)以及通过 Vulkan 的各种 GPU 上运行,并具备纯 C# 的 CPU 后备方案。
相关
- 项目
- 项目
- 项目
- 项目
- 项目