antirez/ds4
DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm
解決的問題
DwarfStar 是一個專為在消費級硬體上執行高效率開源權重模型(特別是 DeepSeek V4(Flash 與 PRO)及 GLM 5.2)而設計的原生推理引擎。它透過 SSD 流式傳輸 MoE 專家與支援激進量化等專用最佳化,解決在 RAM 有限的裝置上執行大型模型的挑戰。
如何運作
此引擎為自我封裝,專注於少數特定模型,而非通用型執行器。它利用多項關鍵技術以最大化效能:
- 硬體後端: 支援 Metal(macOS)、NVIDIA CUDA(含多 GPU 與 DGX Spark)、ROCm(AMD Strix Halo)。
- SSD 流式傳輸: 對於 RAM 不足的裝置,它將未路由的權重保持常駐,同時從 SSD 快取已路由的 MoE 專家,使更大模型得以在可用速度下執行。
- 預測性解碼: 實作「DSpark」,一個輔助草稿模型,可預測未來的詞元以加速生成速度。
- 平行處理: 支援張量平行(例如跨兩台 MacBook)與流水線平行,整合多台系統的 RAM。
- 量化: 使用非對稱量化,已路由的 MoE 專家大幅壓縮(例如 2 位元),而關鍵元件則維持高精度以確保品質。
適用對象
- 擁有高階個人裝置(例如 128GB+ MacBooks、DGX Spark 或 Strix Halo 系統)的進階使用者與開發者。
- 希望將舊有 CUDA 硬體(Ada Lovelace)重新用於多使用者 LLM 伺服器的組織。
- 擅長使用程式碼代理來客製化與最佳化軟體以符合特定硬體的 AI 愛好者。
主要亮點
- 專為 DeepSeek V4 與 GLM 5.2 最佳化: 專注於特定模型,效率高於通用執行器。
- SSD 流式傳輸: 讓原本 RAM 不足的硬體也能執行大型模型。
- 多後端支援: 在 Metal、CUDA 與 ROCm 上實現原生效能。
- DSpark 預測性解碼: 提升程式碼等可預測內容的生成吞吐量。
- 分散式執行: 支援跨多台機器的張量與流水線平行。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch