zhongkaifu/TensorSharp

A native .NET LLM inference engine for GGUF models. TensorSharp provides a console application, a web-based chatbot interface, and Ollama/OpenAI-compatible HTTP APIs for programmatic access. It supports Windows/MacOS/Linux with full GPU capability

해결하는 문제

TensorSharp는 GGUF 형식의 대규모 언어 모델(LLM) 및 다중 모달 모델을 실행하기 위해 설계된 네이티브 .NET 추론 엔진입니다. llama.cpp와 같은 C++ 기반 엔진에 대한 고성능 대안을 제공하여, .NET 개발자가 무거운 외부 종속성에 의존하지 않고 다양한 하드웨어 백엔드에서 네이티브 성능으로 AI 모델을 배포할 수 있도록 합니다.

작동 방식

이 엔진은 GGML(Metal, CUDA, Vulkan), 직접적인 CUDA/cuBLAS 경로, Apple Silicon용 MLX, 그리고 순수 C# CPU 경로를 포함한 광범위한 컴퓨팅 백엔드를 구현합니다. 처리량을 높이고 대기 시간을 줄이기 위해 연속 배치 처리, 페이징 KV 캐싱(vLLM 스타일) 및 추측 디코딩과 같은 고급 최적화 기술을 활용합니다. 매우 큰 모델의 경우 텐서 병렬 처리 및 분산 클러스터링을 지원하여 TCP를 통해 단일 모델을 여러 GPU 또는 여러 머신으로 분할할 수 있습니다.

대상 사용자

주로 다중 모달 LLM을 로컬에서 실행하거나 OpenAI 호환 API를 갖춘 서버로 실행하려는 .NET 개발자 및 AI 엔지니어, 그리고 모델 추론을 위한 고성능 네이티브 .NET 구현을 찾는 사람들을 위한 것입니다.

주요 기능

  • 다중 모달 기능: 자기회귀 LLM, DiffusionGemma 텍스트-디퓨전, 이미지 편집을 위한 Qwen-Image-Edit, 오디오-비디오 결합 생성을 위한 MiniMax-H3를 지원합니다.
  • 고성능: 순수 .NET을 사용하여 특정 워크로드(예: Gemma 4 E4B)에서 llama.cpp의 성능을 일치시키거나 능가합니다.
  • 고급 확장성: 노드 간 분산 추론을 위한 텐서 병렬 처리(--tp) 및 피어 투 피어 TCP 클러스터링을 제공합니다.
  • 추측 디코딩: MTP를 유지하는 GGUF 및 n-gram 매칭을 포함하여 토큰 생성을 가속화하는 네 가지 다른 알고리즘이 포함되어 있습니다.
  • 유연한 배포: 콘솔 애플리케이션, 브라우저 기반 채팅 UI, Ollama/OpenAI 호환 HTTP API와 함께 제공됩니다.
  • 폭넓은 하드웨어 지원: NVIDIA(CUDA), Apple Silicon(Metal/MLX) 및 Vulkan을 통한 다양한 GPU에서 실행되며, 순수 C# CPU 폴백을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트