antirez/ds4

DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm

何を解決するか

DwarfStar は、高パフォーマンスなオープンウェイトモデル(特に DeepSeek V4(Flash および PRO)および GLM 5.2)をコンシューマーハードウェア上で実行するためのネイティブ推論エンジンです。限られた RAM を持つマシンで大規模モデルを実行する課題に対処するために、SSD ストリーミングによる MoE エキスパートの最適化や、積極的な量子化のサポートといった特別な最適化を提供します。

どう動くか

このエンジンは、汎用的なランナーではなく、特定の少数のモデルに特化して最適化された自己完結型です。パフォーマンスを最大化するために、いくつかの重要な技術を活用しています:

  • ハードウェアバックエンド: Metal(macOS)、NVIDIA CUDA(マルチGPUおよびDGX Sparkを含む)、ROCm(AMD Strix Halo)をサポート。
  • SSD ストリーミング: RAMが不足しているマシンでは、ルーティングされていない重みを常駐させながら、SSDからルーティングされた MoE エキスパートをキャッシュすることで、より大きなモデルを実用的な速度で実行可能にします。
  • 予測的デコード: 「DSpark」と呼ばれる補助的なドラフトモデルを実装し、将来のトークンを予測して生成速度を加速します。
  • 並列処理: 2台のMacBook間などでのテンソル並列処理およびパイプライン並列処理をサポートし、複数システムのRAMを統合します。
  • 量子化: ルーティングされた MoE エキスパートを大幅に圧縮(例:2ビット)する非対称量子化を採用し、重要なコンポーネントは高精度のまま維持して品質を確保します。

どんな人向けか

  • 高性能な個人用マシン(例:128GB以上メモリのMacBook、DGX Spark、Strix Haloシステム)を持つパワーユーザーおよび開発者。
  • 古いCUDAハードウェア(Ada Lovelace)を複数ユーザー向けLLMサーバーに再利用したい組織。
  • コーディングエージェントを使ってソフトウェアをカスタマイズ・最適化するのに慣れているAI愛好家。

主な特徴

  • DeepSeek V4 および GLM 5.2 向け最適化: 専門性の高い焦点により、汎用ランナーよりも高い効率性を実現。
  • SSD ストリーミング: RAMが不足するハードウェアでも、巨大なモデルの実行を可能にします。
  • マルチバックエンド対応: Metal、CUDA、ROCm でネイティブパフォーマンスを発揮。
  • DSpark 予測的デコード: コードなど予測可能なコンテンツの生成スループットを向上。
  • 分散実行: 複数マシン間でのテンソル並列およびパイプライン並列処理が可能。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch