antirez/ds4

DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm

解決的問題

DwarfStar 是一個專為在消費級硬體上執行高效率開源權重模型(特別是 DeepSeek V4(Flash 與 PRO)及 GLM 5.2)而設計的原生推理引擎。它透過 SSD 流式傳輸 MoE 專家與支援激進量化等專用最佳化,解決在 RAM 有限的裝置上執行大型模型的挑戰。

如何運作

此引擎為自我封裝,專注於少數特定模型,而非通用型執行器。它利用多項關鍵技術以最大化效能:

  • 硬體後端: 支援 Metal(macOS)、NVIDIA CUDA(含多 GPU 與 DGX Spark)、ROCm(AMD Strix Halo)。
  • SSD 流式傳輸: 對於 RAM 不足的裝置,它將未路由的權重保持常駐,同時從 SSD 快取已路由的 MoE 專家,使更大模型得以在可用速度下執行。
  • 預測性解碼: 實作「DSpark」,一個輔助草稿模型,可預測未來的詞元以加速生成速度。
  • 平行處理: 支援張量平行(例如跨兩台 MacBook)與流水線平行,整合多台系統的 RAM。
  • 量化: 使用非對稱量化,已路由的 MoE 專家大幅壓縮(例如 2 位元),而關鍵元件則維持高精度以確保品質。

適用對象

  • 擁有高階個人裝置(例如 128GB+ MacBooks、DGX Spark 或 Strix Halo 系統)的進階使用者與開發者。
  • 希望將舊有 CUDA 硬體(Ada Lovelace)重新用於多使用者 LLM 伺服器的組織。
  • 擅長使用程式碼代理來客製化與最佳化軟體以符合特定硬體的 AI 愛好者。

主要亮點

  • 專為 DeepSeek V4 與 GLM 5.2 最佳化: 專注於特定模型,效率高於通用執行器。
  • SSD 流式傳輸: 讓原本 RAM 不足的硬體也能執行大型模型。
  • 多後端支援: 在 Metal、CUDA 與 ROCm 上實現原生效能。
  • DSpark 預測性解碼: 提升程式碼等可預測內容的生成吞吐量。
  • 分散式執行: 支援跨多台機器的張量與流水線平行。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch