DwarfStar 4 (ds4) 로컬 추론 엔진
DwarfStar 4는 최첨단 MoE 모델의 로컬 실행을 지원합니다
DwarfStar 4(ds4)는 고메모리 장비에서 최첨단 오픈 웨이트 모델을 로컬로 실행할 수 있도록 설계된 특수 C 추론 엔진입니다. 범용 실행기와 달리 ds4는 의도적으로 '좁은' 범위를 지향하며, DeepSeek V4/V4.1, GLM 5.x, Qwen 3.8 Flash Next와 같은 소수의 고성능 모델 제품군에 집중하여 지원되는 각 레이아웃의 엔드 투 엔드 검증을 보장합니다.
핵심 기술 아키텍처
비대칭 2비트 양자화
대규모 전문가 혼합(MoE) 모델을 소비자용 고메모리 하드웨어에서 실용적으로 사용하기 위해, ds4는 비대칭 2비트 양자화를 활용합니다. 이 기술은 중요한 공유 경로의 정밀도를 유지하면서 라우팅된 전문가 모델을 압축하여, DeepSeek V4 Flash(2,840억 개의 파라미터 모델)와 같은 모델이 가용 VRAM/RAM 내에 적재될 수 있도록 합니다.
KV 캐시 디스크 지속성
Ds4는 KV 캐시를 '디스크 상주 데이터'로 취급합니다. 즉, 긴 프리픽스를 SSD에 저장하고 프롬프트 해시를 통해 재개할 수 있습니다. 이 아키텍처는 세션 재시작 시 전체 프리필(prefill) 과정을 거칠 필요가 없어, 긴 컨텍스트 작업의 효율성을 크게 향상시킵니다.
통합 인터페이스 스택
이 엔진은 동일한 모델 상태와 캐시를 공유하는 세 가지 별도의 인터페이스를 제공합니다:
- CLI (
./ds4): 직접적인 채팅 상호작용용. - Server (
./ds4-server): Codex, Claude Code, OpenCode와 같은 로컬 코딩 에이전트와의 통합을 위한 OpenAI 및 Anthropic 스타일 API 제공. - Agent (
./ds4-agent): 지속적인 코딩 세션을 위해 설계됨.
하드웨어 호환성 및 성능
지원되는 백엔드
Ds4는 Metal(Apple Silicon), CUDA, ROCm용으로 구축되었습니다. 주로 M5 Max Mac 및 DGX Spark 장비와 같은 고사양 소비자 하드웨어에 최적화되어 있습니다.
메모리 요구 사항 및 SSD 스트리밍
최적의 성능을 위해 96GB~128GB RAM이 권장되지만, ds4는 물리적 메모리를 초과하는 모델을 위해 SSD 스트리밍을 지원합니다. 예를 들어, 128GB 시스템에서 DeepSeek V4.1 Q2는 RAM에 모두 적재되지 않는 경우 SSD에서 스트리밍하여 기능을 유지할 수 있습니다.
성능 벤치마크
128GB RAM을 탑재한 M5 Max에서 ds4는 다음과 같은 성능 지표를 달성합니다:
| 컨텍스트 | 프리필 t/s | 생성 t/s |
|---|---|---|
| 2,048 토큰 (q2) | 790.2 | 39.4 |
| 65,536 토큰 (q2) | 398.5 | 27.6 |
커뮤니티 인사이트 및 생태계
사용자와 기여자들은 다양한 포크와 통합을 통해 ds4의 활용도를 확장해 왔습니다. 주목할 만한 커뮤니티 개발 사항은 다음과 같습니다:
- FFI 바인딩: ds4를 공유 라이브러리로 제공하는 포크가 존재하며, 이를 통해
ds4go라는 Go 구현체를 포함하여 다른 언어에서 FFI(Foreign Function Interface)를 통해 사용할 수 있습니다. - Fused TQ: 커뮤니티 기여를 통해 Qwen 3.8 Flash Next 사용 시 128GB M5 Max 장비에서 최대 100만 토큰의 컨텍스트 길이를 지원하는 Fused TQ가 구현되었습니다.
- 대안 도구: 일부 사용자는 주요 ds4 타겟의 높은 메모리 요구 사항을 충족할 수 없는 구형 NVIDIA 3090 시리즈 하드웨어 사용자를 위해
club-3090을 제안합니다.
"모든 가능한 설정을 다루려 하기보다는 가장 큰 사용 사례를 위한 작업 템플릿에 가까워야 합니다." — Project documentation via GitHub
설치 워크플로우
ds4 실행은 3단계 과정을 거칩니다:
- 가중치 가져오기: 저장소를 복제하고 제공된
download_model.sh스크립트를 사용하여 프로젝트 전용 GGUF를 다운로드합니다(일반 GGUF는 지원되지 않음). - 빌드:
make와 특정 백엔드 명령(예:make cuda-spark)을 실행합니다. - 실행: 원하는 컨텍스트 설정으로 CLI 또는 서버를 시작합니다(예:
./ds4-server --ctx 100000).
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트