noonghunna/club-3090

Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.

解决的问题

club-3090 提供了一套经过验证的「配方」(Docker Compose 配置)和工具,帮助用户在 NVIDIA RTX 3090 GPU 上本地部署大型语言模型(LLM)。通过为不同 GPU 数量(单卡或双卡 3090)和多种推理引擎提供验证过的配置,消除了硬件感知模型部署中的试错成本,确保用户在不因 VRAM 限制而崩溃的前提下,最大化吞吐量或上下文窗口大小。

如何工作

该项目使用模型无关的脚本和 Docker Compose 文件框架来部署 LLM。支持多种推理引擎,包括 vLLM、llama.cpp 和 ik_llama。

  • 部署流程:用户可以使用 CLI 向导(launch.sh)或终端 UI 驾驶舱(c3)选择模型和配置变体(例如高吞吐量的双卡设置或稳健的单卡设置)。
  • 硬件感知:工具会预估 VRAM 预算,并根据用户可用的 GPU 数量过滤可运行的变体。
  • 验证:包含一套基准测试(bench.sh)和质量测试(quality-test.sh),用于验证模型是否正确运行,并在不同提示和上下文长度下保持性能。
  • 通用拉取pull 工具会评估 HuggingFace safetensors 仓库,判断模型是否适合当前可用硬件。

适用人群

  • 拥有一或两块 RTX 3090(或 4090/5090)的家用实验室爱好者和开发者,希望在本地运行现代 LLM。
  • 追求稳定性的用户,希望避免「预填充悬崖」(长提示时的 OOM 崩溃),并需要经过验证的、兼容 OpenAI 的 API 端点。

主要亮点

  • 多引擎支持:vLLM(最大吞吐量)、llama.cpp(最大稳健性/上下文)、ik_llama(优化的 GGUF 量化)的验证配方。
  • Llama 风格 TUI:基于键盘的终端 UI(c3),用于发现、部署和监控模型。
  • 详细基准测试:内置工具用于吞吐量(TPS)和行为质量测试。
  • 硬件专用配方:针对单卡(最高 200K 上下文)和双卡(最高 262K 上下文)设置的特定配置。
  • 跨设备诊断:报告工具(report.sh)可生成脱敏、可复制的硬件和堆栈报告,用于故障排查。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch