z-lab/dflash
DFlash: Block Diffusion for Flash Speculative Decoding
何を解決するか
DFlashは、大規模言語モデル(LLM)におけるトークン単位の生成の遅さを解決するために、より効率的な推論手法である推測的デコードを実装しています。高品質な並列ドラフト生成を可能にし、ターゲットモデルが応答を生成するまでの時間を短縮します。
動作方法
軽量なブロック拡散モデルをドラフトモデルとして使用します。このドラフトモデルは、1トークンずつではなく、複数のトークンを並列で予測し、ターゲットLLMが一度のパスで検証します。このシステムは、Transformers、MLX(Apple Silicon用)、SGLangやvLLMなどのOpenAI互換サーバーなど、複数のバックエンドをサポートしています。
対象ユーザー
推測的デコードを通じて生成スループットを向上させ、遅延を低減したいLLM推論に取り組む開発者や研究者。
特徴
- 並列ドラフト生成: ブロック拡散を活用して、複数のトークン候補を同時に生成します。
- 広範なモデル対応: Qwen、Gemma、MiniMax、Kimi、Llama-3.1など、幅広いモデルと互換性があります。
- 柔軟なデプロイメント: Mac用ローカルMLXやサーバー側のvLLM/SGLangなど、さまざまなハードウェア・ソフトウェアスタックで動作します。
- 統合されたベンチマーク: GSM8KやHumanEvalなどのデータセット上でパフォーマンスを評価するための組み込みツールを備えています。
関連
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト