antirez/ds4

DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm

해결하는 문제

DwarfStar는 고성능 오픈웨이트 모델(특히 DeepSeek V4(Flash 및 PRO) 및 GLM 5.2)을 소비자용 하드웨어에서 실행하기 위해 설계된 네이티브 추론 엔진입니다. 제한된 RAM을 가진 기기에서 대규모 모델을 실행하는 문제를 해결하기 위해 SSD 스트리밍을 통한 MoE 전문가 최적화 및 강력한 양자화 지원과 같은 특수 최적화를 제공합니다.

작동 방식

이 엔진은 일반적인 러너가 아니라 특정 모델 집합에 특화된 자체 포함형이며, 성능을 극대화하기 위해 여러 핵심 기술을 활용합니다:

  • 하드웨어 백엔드: Metal(macOS), NVIDIA CUDA(멀티GPU 및 DGX Spark 포함), ROCm(AMD Strix Halo)을 지원합니다.
  • SSD 스트리밍: RAM이 부족한 기기에서는 루팅되지 않은 가중치를 지속적으로 유지하면서 SSD에서 루팅된 MoE 전문가를 캐시하여 더 큰 모델을 사용 가능한 속도로 실행할 수 있습니다.
  • 예측적 디코딩: 향후 토큰을 제안하여 생성 속도를 가속화하는 보조 드래프트 모델인 "DSpark"를 구현합니다.
  • 병렬 처리: 두 대의 맥북 간의 텐서 병렬 처리 및 파이프라인 병렬 처리를 지원하여 여러 시스템의 RAM을 통합합니다.
  • 양자화: 루팅된 MoE 전문가를 강하게 압축(예: 2비트)하지만 핵심 구성 요소는 고정밀 유지하여 품질을 유지합니다.

누구를 위한가

  • 고성능 개인용 기기(예: 128GB 이상 메모리의 맥북, DGX Spark, Strix Halo 시스템)를 보유한 파워 유저 및 개발자.
  • 오래된 CUDA 하드웨어(Ada Lovelace)를 다중 사용자 LLM 서버로 재활용하려는 조직.
  • 코딩 에이전트를 사용해 소프트웨어를 특정 하드웨어에 맞게 사용자 정의하고 최적화하는 데 익숙한 AI 애호가.

주요 특징

  • DeepSeek V4 및 GLM 5.2에 최적화: 좁은 초점으로 인해 일반 러너보다 더 높은 효율성 제공.
  • SSD 스트리밍: RAM이 부족한 하드웨어에서도 거대한 모델을 실행 가능하게 합니다.
  • 다중 백엔드 지원: Metal, CUDA, ROCm에서 네이티브 성능을 발휘합니다.
  • DSpark 예측적 디코딩: 코드와 같은 예측 가능한 콘텐츠의 생성 처리량을 증가시킵니다.
  • 분산 실행: 여러 기기 간 텐서 및 파이프라인 병렬 처리가 가능합니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch