antirez/ds4
DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm
解决的问题
DwarfStar 是一个专为在消费级硬件上运行高性能开源权重模型(特别是 DeepSeek V4(Flash 和 PRO)和 GLM 5.2)而设计的原生推理引擎。它通过 SSD 流式传输 MoE 专家和支持激进量化等专用优化,解决了在 RAM 有限的设备上运行大模型的挑战。
如何工作
该引擎是自包含的,专注于少数特定模型而非通用运行器。它利用多种关键技术以最大化性能:
- 硬件后端: 支持 Metal(macOS)、NVIDIA CUDA(包括多 GPU 和 DGX Spark)、ROCm(AMD Strix Halo)。
- SSD 流式传输: 对于 RAM 不足的设备,它将未路由的权重保持驻留,同时从 SSD 缓存已路由的 MoE 专家,从而在可用速度下运行更大模型。
- 推测性解码: 实现了 "DSpark",一个辅助草稿模型,可预测未来令牌以加速生成速度。
- 并行处理: 支持张量并行(例如跨两台 MacBook)和流水线并行,以整合多台设备的 RAM。
- 量化: 使用非对称量化,已路由的 MoE 专家被大幅压缩(例如 2 位),而关键组件保持高精度以维持质量。
适合人群
- 拥有高端个人设备(例如 128GB+ MacBooks、DGX Spark 或 Strix Halo 系统)的高级用户和开发者。
- 希望将旧的 CUDA 硬件(Ada Lovelace)重新用于多用户 LLM 服务器的组织。
- 习惯使用编码代理来为其特定硬件定制和优化软件的 AI 爱好者。
主要亮点
- 专为 DeepSeek V4 与 GLM 5.2 优化: 聚焦特定模型,效率高于通用运行器。
- SSD 流式传输: 使原本 RAM 不足的硬件也能执行大型模型。
- 多后端支持: 在 Metal、CUDA 和 ROCm 上实现原生性能。
- DSpark 推测性解码: 提升代码等可预测内容的生成吞吐量。
- 分布式执行: 支持跨多台机器的张量并行和流水线并行。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch