z-lab/dflash

DFlash: Block Diffusion for Flash Speculative Decoding

何を解決するか

DFlashは、大規模言語モデル(LLM)におけるトークン単位の生成の遅さを解決するために、より効率的な推論手法である推測的デコードを実装しています。高品質な並列ドラフト生成を可能にし、ターゲットモデルが応答を生成するまでの時間を短縮します。

動作方法

軽量なブロック拡散モデルをドラフトモデルとして使用します。このドラフトモデルは、1トークンずつではなく、複数のトークンを並列で予測し、ターゲットLLMが一度のパスで検証します。このシステムは、Transformers、MLX(Apple Silicon用)、SGLangやvLLMなどのOpenAI互換サーバーなど、複数のバックエンドをサポートしています。

対象ユーザー

推測的デコードを通じて生成スループットを向上させ、遅延を低減したいLLM推論に取り組む開発者や研究者。

特徴

  • 並列ドラフト生成: ブロック拡散を活用して、複数のトークン候補を同時に生成します。
  • 広範なモデル対応: Qwen、Gemma、MiniMax、Kimi、Llama-3.1など、幅広いモデルと互換性があります。
  • 柔軟なデプロイメント: Mac用ローカルMLXやサーバー側のvLLM/SGLangなど、さまざまなハードウェア・ソフトウェアスタックで動作します。
  • 統合されたベンチマーク: GSM8KやHumanEvalなどのデータセット上でパフォーマンスを評価するための組み込みツールを備えています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト