Laguna XS.2 推論の最適化: vLLM、Speculators、LLM Compressor を使用
Laguna XS.2 推論の最適化: vLLM、Speculators、LLM Compressor を使用
Poolside と Red Hat AI は、Laguna XS.2 モデルを高性能なエージェンティック コーディングおよび長時間ソフトウェア タスク向けに最適化しました。Laguna XS.2 を vLLM に統合し、DFlash スペキュラティブ デコーディングと LLM Compressor 量子化を実装することで、チームは生成品質を犠牲にすることなく推論レイテンシを削減し、運用効率を向上させました。
ファーストクラス vLLM 統合
Laguna XS.2 は、ファーストクラスの市民として vLLM に直接統合されています。この統合により、開発者は標準の vLLM API を使用してすぐにモデルをデプロイでき、既存の本番推論パイプラインとのシームレスな互換性が確保されます。
DFlash スペキュラティブ デコーディングによる推論の高速化
Red Hat AI は Speculators ライブラリを使用して Laguna XS.2 用の DFlash スペキュレータを訓練し、トークン生成速度を 2-3 倍向上させ、生成品質に損なわれることなく実現しました。
DFlash の技術的実装
DFlash アルゴリズムは、小さな 5 層、0.6B ドラフト モデルがターゲット Laguna XS.2 モデルからの隠れ状態入力を使用してトークン ブロックを予測できるようにします。これらの予測トークンは、Laguna XS.2 によって 1 回のフォワード パスで検証されます。トークンが受け入れられた場合、標準の自己回帰生成よりもはるかに高速に生成されます。この検証プロセスにより、出力品質が大規模モデルのみを使用した場合と同一であることが保証されます。
トレーニング方法論
DFlash スペキュレータは次のパラメータで訓練されました:
- データセット: Ultrachat 200k SFT と Magpie-Align から 500k サンプル。プロンプトはサンプリングされ、思考を有効にした Laguna XS.2 から応答が再生成されました。
- トレーニング期間: コサイン スケジューラを使用した 6 エポック。
- 学習率: 最大学習率 6e-4。
- シーケンス長: 8192。
- サンプリング: 各シーケンスに対して 3072 ブロック位置がランダムにサンプリングされました。
この構成により、5 層のドラフターは 1 回のフォワード パスで 8 トークンを予測でき、Eagle-3 パラダイムを超えてインタートークン レイテンシを削減し、より高速で並列なドラフティングを提供します。
LLM Compressor 量子化による効率的なデプロイメント
多様なハードウェアとメモリ要件に対応するため、Poolside は LLM Compressor ライブラリを使用して compressed-tensors 形式で Laguna XS.2 の量子化チェックポイントをリリースしました。利用可能なバリアントには次のものがあります:
- FP8
- NVFP4
- INT4/INT8
これらの量子化チェックポイントにより、開発者は vLLM 内でモデル品質を維持しながら、ハードウェア利用率、レイテンシ、メモリ消費のバランスを最適化できます。