varunvasudeva1/llm-server-docs

End-to-end documentation to set up your own local & fully private LLM server on Debian. Equipped with chat, web search, RAG, model management, MCP servers, image generation, and TTS.

What it solves

本项目提供了一份在 Debian Linux 上搭建私有本地 LLM 服务器的完整端到端指南。它解决了协调多个 AI 组件(如推理引擎、聊天界面和搜索工具)的复杂性,同时确保系统安全、稳定,并且对 Linux 初学者友好,易于维护。

How it works

指南带领用户通过一个模块化的软件栈,集成多个开源工具:

  • Inference:使用 Ollama、llama.cpp 或 vLLM 运行模型。
  • Interface:以 Open WebUI 作为主要聊天平台。
  • Capabilities:集成 SearXNG 进行网页搜索,Kokoro FastAPI 实现文字转语音,ComfyUI 用于图像生成。
  • Infrastructure:使用 Docker 进行容器化,Caddy 作为反向代理,Tailscale 提供安全的远程访问。
  • System Optimization:提供 GPU 限功脚本以降低能耗,并使用 systemd 管理服务。

Who it’s for

本指南面向希望在本地自行托管 AI 基础设施的个人,尤其是使用 Debian(或类似 Linux 发行版)且对服务器管理不熟悉的用户。

Highlights

  • Full-Stack Integration:覆盖从操作系统安装、GPU 驱动到高级 AI 应用的全部内容。
  • Privacy-Focused:强调完全私有化,数据不会离开本地机器。
  • Modular Design:鼓励使用标准协议(如 OpenAI 兼容性和 MCP),便于组件自由替换。
  • Hardware Agnostic:提供 Nvidia GPU、AMD GPU 以及仅 CPU 环境的配置指南。
  • Security-First:包含防火墙配置、Docker 网络隔离以及通过 VPN 的安全远程访问步骤。