antirez/ds4

DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm

解决的问题

DwarfStar 是一个专为在消费级硬件上运行高性能开源权重模型(特别是 DeepSeek V4(Flash 和 PRO)和 GLM 5.2)而设计的原生推理引擎。它通过 SSD 流式传输 MoE 专家和支持激进量化等专用优化,解决了在 RAM 有限的设备上运行大模型的挑战。

如何工作

该引擎是自包含的,专注于少数特定模型而非通用运行器。它利用多种关键技术以最大化性能:

  • 硬件后端: 支持 Metal(macOS)、NVIDIA CUDA(包括多 GPU 和 DGX Spark)、ROCm(AMD Strix Halo)。
  • SSD 流式传输: 对于 RAM 不足的设备,它将未路由的权重保持驻留,同时从 SSD 缓存已路由的 MoE 专家,从而在可用速度下运行更大模型。
  • 推测性解码: 实现了 "DSpark",一个辅助草稿模型,可预测未来令牌以加速生成速度。
  • 并行处理: 支持张量并行(例如跨两台 MacBook)和流水线并行,以整合多台设备的 RAM。
  • 量化: 使用非对称量化,已路由的 MoE 专家被大幅压缩(例如 2 位),而关键组件保持高精度以维持质量。

适合人群

  • 拥有高端个人设备(例如 128GB+ MacBooks、DGX Spark 或 Strix Halo 系统)的高级用户和开发者。
  • 希望将旧的 CUDA 硬件(Ada Lovelace)重新用于多用户 LLM 服务器的组织。
  • 习惯使用编码代理来为其特定硬件定制和优化软件的 AI 爱好者。

主要亮点

  • 专为 DeepSeek V4 与 GLM 5.2 优化: 聚焦特定模型,效率高于通用运行器。
  • SSD 流式传输: 使原本 RAM 不足的硬件也能执行大型模型。
  • 多后端支持: 在 Metal、CUDA 和 ROCm 上实现原生性能。
  • DSpark 推测性解码: 提升代码等可预测内容的生成吞吐量。
  • 分布式执行: 支持跨多台机器的张量并行和流水线并行。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch