MiaAI-Lab/Qwen3.8-27B-16gb-NVIDIA-GPUs-one-click-install
Qwen3.8-27B on 16-32 GB Nvidia GPUs one-click install for Windows / Linux
해결하는 문제
이 프로젝트는 12GB에서 32GB의 VRAM을 갖춘 소비자용 NVIDIA GPU에서 Qwen3.8-27B 모델의 "원클릭" 설치 및 서빙 키트를 제공합니다. 사용자의 하드웨어에 따라 환경 설정, 가중치 다운로드, 양자화 선택의 복잡성을 자동화하여 제거합니다.
작동 방식
이 키트는 EXL3 양자화(주로 turboderp에서 제공)를 사용하여 대규모 모델을 제한된 VRAM에 맞춥니다. 런처 스크립트(simplex)는 nvidia-smi를 통해 사용자의 GPU VRAM을 분석하고, 카드에 맞는 최적의 양자화 수준(bpw)과 컨텍스트 크기를 자동으로 선택합니다. 이후 자체 포함형 Python 가상 환경을 생성하고, 필요한 가중치를 다운로드한 후 OpenAI 호환 API 엔드포인트를 통해 모델을 제공합니다. 사용자 인터페이스로는 DeepSeek Harness(dsh)를 통합하여, 노드 기반의 채팅 UI를 자동으로 설정합니다. 로드된 모델의 기능에 따라 자동으로 구성됩니다.
대상 사용자
CUDA 툴킷, 컴파일러, 복잡한 설정 파일을 수동으로 관리할 필요 없이 Windows 또는 Linux에서 Qwen3.8-27B를 로컬로 실행하고자 하는 NVIDIA GPU(Turing 아키텍처 이상) 사용자.
주요 특징
- 하드웨어 인식 자동화: 감지된 VRAM(12GB, 16GB, 24GB, 32GB 이상)에 따라 최적의 모델 양자화 및 컨텍스트 창을 자동 선택.
- 자체 포함 설치: 관리자 권한이나 시스템 전체 Python 변경 없이 자체 폴더(venv, models, logs)에 모든 것을 설치.
- OpenAI 호환 API: 다른 도구와의 통합을 위한
/v1엔드포인트 제공. - 재시도 가능한 다운로드: 모델 가중치 다운로드를 중단하고 다시 시작해도 데이터 손실 없음.
- 통합 채팅 UI: DeepSeek Harness를 배포하여 자동 모델 설정과 함께 즉시 사용 가능한 채팅 경험 제공.
- 크로스 플랫폼: Windows와 Linux 모두에서 동일한 명령줄 인터페이스(
simplex) 사용.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트