noonghunna/club-3090
Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.
해결하는 문제
club-3090는 NVIDIA RTX 3090 GPU에서 로컬로 대규모 언어 모델(LLM)을 실행하기 위한 검증된 "레시피"(Docker Compose 구성)와 도구를 제공합니다. 단일 또는 이중 3090 GPU 환경과 다양한 추론 엔진에 맞춘 검증된 설정을 통해 VRAM 한계로 인한 충돌 없이 최대 스루풋 또는 컨텍스트 길이를 확보할 수 있도록 도와줍니다.
작동 방식
이 프로젝트는 모델에 독립적인 스크립트와 Docker Compose 파일 프레임워크를 사용하여 LLM을 배포합니다. vLLM, llama.cpp, ik_llama 등의 여러 추론 엔진을 지원합니다.
- 배포 흐름: 사용자는 CLI 워즈(
launch.sh) 또는 터미널 UI 코크피트(c3)를 사용하여 모델과 설정 변형(예: 고스루풋 이중 카드 설정 또는 강력한 단일 카드 설정)을 선택할 수 있습니다. - 하드웨어 인식: 도구는 VRAM 예산을 예측하고 사용 가능한 GPU 수에 따라 실행 가능한 변형을 필터링합니다.
- 검증:
bench.sh와quality-test.sh를 포함한 벤치마크 및 품질 테스트 세트를 통해 모델이 올바르게 실행되고 다양한 프롬프트 및 컨텍스트 길이에서 성능을 유지하는지 확인합니다. - 유니버설 풀:
pull유틸리티는 HuggingFace safetensors 리포지토리를 평가하여 모델이 사용 가능한 하드웨어에 맞는지 판단합니다.
대상 사용자
- RTX 3090(또는 4090/5090)을 하나 또는 두 개 보유하고 있으며 현대적인 LLM을 로컬에서 실행하고자 하는 홈랩 애호가 및 개발자.
- 장문 프롬프트 중 "프리필 클리프"(OOM 충돌)를 피하고 검증된 OpenAI 호환 API 엔드포인트를 원하는 사용자.
주요 특징
- 다중 엔진 지원: vLLM(최대 스루풋), llama.cpp(최대 안정성/컨텍스트), ik_llama(최적화된 GGUF 양자화)의 검증된 레시피.
- Llama 스타일 TUI: 키보드 기반 터미널 UI(
c3)를 통해 모델 탐색, 실행, 모니터링이 가능합니다. - 세부 벤치마크: 스루풋(TPS) 및 행동 품질 테스트를 위한 내장 도구.
- 하드웨어 전용 레시피: 단일 카드(최대 200K 컨텍스트) 및 이중 카드(최대 262K 컨텍스트) 설정에 특화된 구성.
- 크로스 릭 진단: 오류 해결을 위한 레드액트된, 복사 가능한 하드웨어 및 스택 리포트를 생성하는 보고 도구(
report.sh).
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch