DwarfStar 4 (ds4) により、大容量メモリ搭載のMacやGPUで最先端LLMのローカル推論が可能に

TL;DR – ds4が提供するものとその重要性

DwarfStar 4 (ds4) を使用すると、DeepSeek V4/V4.1、GLM 5.x、Qwen 3.8 といった最先端の重みを持つ大規模言語モデルを、大容量メモリを搭載したMac、NVIDIA CUDA、または AMD ROCm ハードウェア上でローカル実行できます。 これは、MoE(混合エキスパート)の専門家層を非対称2ビット量子化で圧縮し、KVキャッシュをSSDにストリーミングすることで実現しています。これにより、2840億パラメータのモデルを単一のワークステーションで推論可能にし、高コストなリモートAPI呼び出しを不要にします。


コア設計 – 専用の推論スタック

ds4は、特定の少数のMoEモデルをターゲットとし、各レイアウトをエンドツーエンドで検証する、C言語のみで構築された軽量エンジンです。 汎用的な GGUF ランナーとは異なり、ds4は3つのモデルファミリー(DeepSeek V4/V4.1、GLM 5.x、Qwen 3.8)に焦点を当て、CLI (./ds4)、ローカルHTTPサーバー (./ds4-server)、永続的なコーディングエージェント (./ds4-agent) という3つの統合インターフェースを提供します。

非対称2ビット量子化

"ルーティングされた専門家層を圧縮し、重要な共有パスの精度を維持する。これが、サポートされているルーティングMoEモデルがターゲットマシンに収まる仕組みです。" – ds4 ドキュメント

  • Mixture-of-Experts (MoE) レイヤー内の専門家層は2ビットに量子化されます。
  • 共有ルーティングおよびアテンションパスは高い精度を維持し、モデルの品質を保持します。
  • この技術により、2840億パラメータの DeepSeek V4 モデルを128GBのシステムで実行可能にします。

KVキャッシュのSSD活用

"長いプレフィックスをSSDに保存し、プロンプトハッシュで再開する。再起動のたびに完全なプリフィルを行う必要はありません。" – ds4 ドキュメント

  • プレフィックスKVキャッシュをSSDにフラッシュできるため、RAMを使い果たすことなく最大65kトークンのコンテキストを扱えます。
  • プロンプトハッシュに基づいた再開機能により、再起動後の再プリフィルを回避でき、長時間稼働するエージェントにとって不可欠です。

統合された3つのインターフェースによるモデル状態管理

  • ./ds4 – インタラクティブなチャットCLI。
  • ./ds4-server – エディタ、エージェント、またはカスタムクライアント向けのOpenAI互換HTTP API。
  • ./ds4-agent – 状態管理が組み込まれた永続的なコーディングセッション。

サポートされているモデルとハードウェアの適合性

ds4は現在以下をサポートしています:

  • DeepSeek V4 & V4.1 Flash (Mixture-of-Experts, 2840億パラメータ)
  • GLM 5.x (Flashバリアントを含む)
  • Qwen 3.8 Flash Next (オプションでビジョン対応)

メモリ要件とパフォーマンス

プラットフォーム メモリ モデル (量子化) コンテキスト プリフィル t/s 生成 t/s
Apple M5 Max 128 GB DeepSeek V4 Q2 2 048 tok 790.2 39.4
Apple M5 Max 128 GB DeepSeek V4 Q2 65 536 tok 398.5 27.6
NVIDIA DGX Spark 128 GB DeepSeek V4 Q2 2 048 tok 825.8 18.1
NVIDIA DGX Spark 128 GB DeepSeek V4 Q2 65 536 tok 823.0 13.8

ベンチマーク表はds4のウェブサイトから直接引用しています。

ハードウェアマトリックス – ベースラインモデル (DeepSeek V4 Q2) は、128GBのシステムであれば快適に動作します。GLM 5.3 Q2 および Qwen Q4 も128GBで収まりますが、DeepSeek V4.1 Q2 はSSDからストリーミングされるため、64GBのMacでも動作可能です。


クイックスタートワークフロー

  1. GGUFの重みをフェッチする
    git clone https://github.com/antirez/ds4
    cd ds4 && ./download_model.sh ds4f-q2
    
  2. バックエンド用にビルドする (Metal, CUDA, または ROCm)
    make            # 汎用ビルド (macOSではMetal)
    make cuda-spark # CUDA最適化ビルド
    
  3. 実行する
    ./ds4                     # インタラクティブCLI
    ./ds4-server --ctx 100000 # OpenAI互換APIの起動
    

ds4は任意のGGUFファイルの実行を目的としておらず、検証済みのモデルレイアウトのみがサポートされています。


コミュニティ拡張とエコシステム

  • ds4go – 他の言語からds4を共有ライブラリとして呼び出せるようにするGo FFIラッパーおよびTUI。@neomantra によって保守されており、VisionとQwenのサポートを追加し、Homebrewでインストール可能なバイナリを提供しています。(GitHub release v0.8.20260)
  • Club-3090 server – @gchamon が保守するds4用のWebフロントエンド。ローカルエンジンへのリモートアクセスを可能にします。
  • カスタムSSDキャッシュフォーク – ユーザーがディスクキャッシュ機能を llama.cpp や他のランナーにバックポートしています (例: @xlayn のフォーク)。

ds4と他のローカルランナーの違い

機能 ds4 llama.cpp / ollama
特定のMoEモデル (DeepSeek V4, GLM 5.x, Qwen 3.8) ✅ ❌ (汎用GGUFのみ)
専門家層の非対称2ビット量子化 ✅ ❌ (通常は均一量子化)
SSDへのKVキャッシュ永続化 ✅ ❌ (メモリ内のみ)
CLI、サーバー、エージェントで状態を共有 ✅ 部分的 (バイナリが分離)
Apple Silicon向けのMetalファースト実装 ✅ 限定的 (主にCPU)

コミュニティメンバーは、ds4の「依存関係を最小限にする」という哲学が Redis に似ており、軽量で組み込みやすいと評価しています。


未解決の質問とコミュニティからのフィードバック

  • ツール呼び出しのパフォーマンス – @cuttothechase などのユーザーは、関数呼び出し時のTPS(1秒あたりのトークン数)を求めています。現在のベンチマークは、生のプリフィルと生成速度に焦点を当てています。
  • 量子化後のモデル品質 – @doctorpangloss は、強力な量子化後の DeepSeek V4 チェックポイントの品質について懸念を述べています。
  • Apple Siliconでの最小RAM – ウェブサイトではSSDストリーミング実行の下限として64GBを挙げていますが、GitHubのREADMEではフルスピードのMetal実行には96GBが必要とされており、混乱が見られます。
  • 他のランナーとの比較 – 複数のコメント投稿者 (例: @locknitpicker) が ollama や llama.cpp との速度比較を求めていますが、ds4のニッチな領域は汎用的なGGUFサポートではなく、MoE固有の最適化にあります。

結論

ds4は、非対称量子化とSSDベースのKVキャッシュを活用してメモリ制限を克服し、最先端の重みを持つMoEモデルを単一のワークステーションでローカル実行するための実用的な道筋を提供します。 焦点を絞ったモデルサポート、依存関係の少ないC言語実装、そして3つの統合インターフェースにより、クラウドの遅延なしに高品質な推論を必要とするユーザーにとって、汎用ランナーに代わる魅力的な選択肢となっています。

Sources

関連