DwarfStar 4 (ds4) により、大容量メモリ搭載のMacやGPUで最先端LLMのローカル推論が可能に
TL;DR – ds4が提供するものとその重要性
DwarfStar 4 (ds4) を使用すると、DeepSeek V4/V4.1、GLM 5.x、Qwen 3.8 といった最先端の重みを持つ大規模言語モデルを、大容量メモリを搭載したMac、NVIDIA CUDA、または AMD ROCm ハードウェア上でローカル実行できます。 これは、MoE(混合エキスパート)の専門家層を非対称2ビット量子化で圧縮し、KVキャッシュをSSDにストリーミングすることで実現しています。これにより、2840億パラメータのモデルを単一のワークステーションで推論可能にし、高コストなリモートAPI呼び出しを不要にします。
コア設計 – 専用の推論スタック
ds4は、特定の少数のMoEモデルをターゲットとし、各レイアウトをエンドツーエンドで検証する、C言語のみで構築された軽量エンジンです。 汎用的な GGUF ランナーとは異なり、ds4は3つのモデルファミリー(DeepSeek V4/V4.1、GLM 5.x、Qwen 3.8)に焦点を当て、CLI (./ds4)、ローカルHTTPサーバー (./ds4-server)、永続的なコーディングエージェント (./ds4-agent) という3つの統合インターフェースを提供します。
非対称2ビット量子化
"ルーティングされた専門家層を圧縮し、重要な共有パスの精度を維持する。これが、サポートされているルーティングMoEモデルがターゲットマシンに収まる仕組みです。" – ds4 ドキュメント
- Mixture-of-Experts (MoE) レイヤー内の専門家層は2ビットに量子化されます。
- 共有ルーティングおよびアテンションパスは高い精度を維持し、モデルの品質を保持します。
- この技術により、2840億パラメータの DeepSeek V4 モデルを128GBのシステムで実行可能にします。
KVキャッシュのSSD活用
"長いプレフィックスをSSDに保存し、プロンプトハッシュで再開する。再起動のたびに完全なプリフィルを行う必要はありません。" – ds4 ドキュメント
- プレフィックスKVキャッシュをSSDにフラッシュできるため、RAMを使い果たすことなく最大65kトークンのコンテキストを扱えます。
- プロンプトハッシュに基づいた再開機能により、再起動後の再プリフィルを回避でき、長時間稼働するエージェントにとって不可欠です。
統合された3つのインターフェースによるモデル状態管理
./ds4– インタラクティブなチャットCLI。./ds4-server– エディタ、エージェント、またはカスタムクライアント向けのOpenAI互換HTTP API。./ds4-agent– 状態管理が組み込まれた永続的なコーディングセッション。
サポートされているモデルとハードウェアの適合性
ds4は現在以下をサポートしています:
- DeepSeek V4 & V4.1 Flash (Mixture-of-Experts, 2840億パラメータ)
- GLM 5.x (Flashバリアントを含む)
- Qwen 3.8 Flash Next (オプションでビジョン対応)
メモリ要件とパフォーマンス
| プラットフォーム | メモリ | モデル (量子化) | コンテキスト | プリフィル t/s | 生成 t/s |
|---|---|---|---|---|---|
| Apple M5 Max | 128 GB | DeepSeek V4 Q2 | 2 048 tok | 790.2 | 39.4 |
| Apple M5 Max | 128 GB | DeepSeek V4 Q2 | 65 536 tok | 398.5 | 27.6 |
| NVIDIA DGX Spark | 128 GB | DeepSeek V4 Q2 | 2 048 tok | 825.8 | 18.1 |
| NVIDIA DGX Spark | 128 GB | DeepSeek V4 Q2 | 65 536 tok | 823.0 | 13.8 |
ベンチマーク表はds4のウェブサイトから直接引用しています。
ハードウェアマトリックス – ベースラインモデル (DeepSeek V4 Q2) は、128GBのシステムであれば快適に動作します。GLM 5.3 Q2 および Qwen Q4 も128GBで収まりますが、DeepSeek V4.1 Q2 はSSDからストリーミングされるため、64GBのMacでも動作可能です。
クイックスタートワークフロー
- GGUFの重みをフェッチする
git clone https://github.com/antirez/ds4 cd ds4 && ./download_model.sh ds4f-q2 - バックエンド用にビルドする (Metal, CUDA, または ROCm)
make # 汎用ビルド (macOSではMetal) make cuda-spark # CUDA最適化ビルド - 実行する
./ds4 # インタラクティブCLI ./ds4-server --ctx 100000 # OpenAI互換APIの起動
ds4は任意のGGUFファイルの実行を目的としておらず、検証済みのモデルレイアウトのみがサポートされています。
コミュニティ拡張とエコシステム
- ds4go – 他の言語からds4を共有ライブラリとして呼び出せるようにするGo FFIラッパーおよびTUI。@neomantra によって保守されており、VisionとQwenのサポートを追加し、Homebrewでインストール可能なバイナリを提供しています。(GitHub release v0.8.20260)
- Club-3090 server – @gchamon が保守するds4用のWebフロントエンド。ローカルエンジンへのリモートアクセスを可能にします。
- カスタムSSDキャッシュフォーク – ユーザーがディスクキャッシュ機能を llama.cpp や他のランナーにバックポートしています (例: @xlayn のフォーク)。
ds4と他のローカルランナーの違い
| 機能 | ds4 | llama.cpp / ollama |
|---|---|---|
| 特定のMoEモデル (DeepSeek V4, GLM 5.x, Qwen 3.8) | ✅ | ❌ (汎用GGUFのみ) |
| 専門家層の非対称2ビット量子化 | ✅ | ❌ (通常は均一量子化) |
| SSDへのKVキャッシュ永続化 | ✅ | ❌ (メモリ内のみ) |
| CLI、サーバー、エージェントで状態を共有 | ✅ | 部分的 (バイナリが分離) |
| Apple Silicon向けのMetalファースト実装 | ✅ | 限定的 (主にCPU) |
コミュニティメンバーは、ds4の「依存関係を最小限にする」という哲学が Redis に似ており、軽量で組み込みやすいと評価しています。
未解決の質問とコミュニティからのフィードバック
- ツール呼び出しのパフォーマンス – @cuttothechase などのユーザーは、関数呼び出し時のTPS(1秒あたりのトークン数)を求めています。現在のベンチマークは、生のプリフィルと生成速度に焦点を当てています。
- 量子化後のモデル品質 – @doctorpangloss は、強力な量子化後の DeepSeek V4 チェックポイントの品質について懸念を述べています。
- Apple Siliconでの最小RAM – ウェブサイトではSSDストリーミング実行の下限として64GBを挙げていますが、GitHubのREADMEではフルスピードのMetal実行には96GBが必要とされており、混乱が見られます。
- 他のランナーとの比較 – 複数のコメント投稿者 (例: @locknitpicker) が ollama や llama.cpp との速度比較を求めていますが、ds4のニッチな領域は汎用的なGGUFサポートではなく、MoE固有の最適化にあります。
結論
ds4は、非対称量子化とSSDベースのKVキャッシュを活用してメモリ制限を克服し、最先端の重みを持つMoEモデルを単一のワークステーションでローカル実行するための実用的な道筋を提供します。 焦点を絞ったモデルサポート、依存関係の少ないC言語実装、そして3つの統合インターフェースにより、クラウドの遅延なしに高品質な推論を必要とするユーザーにとって、汎用ランナーに代わる魅力的な選択肢となっています。
Sources
関連
- Dispatch
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト