spiritbuun/buun-llama-cpp
Experimental llama.cpp fork for inference research and development
解決する課題
buun-llama-cpp は、VRAM 制約のあるハードウェア上で LLM 推論効率を最大化するために設計された llama.cpp の実験的研究フォークです。動的 KV キャッシュ量子化と高度な MoE(混合専門家)キャッシュ戦略を導入することで、コンテキスト長、メモリ使用量、モデル品質のトレードオフに具体的に対処します。
仕組み
このプロジェクトは、いくつかの重要な技術的革新を実装しています:
- 可変ビットレート(VBR)KV キャッシュ:固定の量子化レベルではなく、セッションが成長するにつれて KV キャッシュを動的に量子化します。FP16 から始まり、VRAM の圧力が必要な場合にのみ、事前定義された「ラダー」コーデックを使用してレイヤーごとに劣化させ、現在のコンテキスト深度に対して可能な限り最高の品質を保証します。
- トレリス符号化量子化(TCQ):512 状態のトレリスとビタビ符号化を使用する特殊なコーデックで、標準のスカラー量子化と比較して、非常に低いビットレート(2〜3 ビット)で KL ダイバージェンス(誤差)を大幅に削減します。
- MoE キャッシュ:大規模な MoE モデル(DeepSeek V4 Flash など)の場合、ルーティングされた専門家をシステム RAM に常駐させ、推論を高速化するために「ホット」な専門家テンソルを予備の VRAM にキャッシュできます。
- ビジョン用 GPU スワップ:VRAM を節約するために、画像が処理されるときにのみビジョンエンコーダ(
mmproj)を GPU にロードするために、投機的デコードコンポーネントを一時的にアンロードし、その後スワップバックできます。
対象読者
コンシューマー GPU(例:RTX 3090)で大規模モデルを扱う開発者や研究者で、モデルの精度をあまり犠牲にせずにコンテキストウィンドウサイズと推論速度の限界を押し広げる必要がある人。
ハイライト
- 動的品質制御:VBR により、キャッシュは FP16 から 1.25 ビット/値まで優雅に劣化できます。
- 高効率コーデック:TCQ は 3.25 ビット/値で FP16 に近いパープレキシティを提供します。
- 適応型 MoE 管理:大規模 MoE モデル向けの自動フィッティングとエキスパート並列ディスパッチ。
- VRAM 最適化:ビジョンエンコーダと投機的デコードサイドカー間のインテリジェントなスワッピング。
関連
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch
- Dispatch