使用 vLLM、Speculators 與 LLM Compressor 進行 Laguna XS.2 推論優化
使用 vLLM、Speculators 與 LLM Compressor 進行 Laguna XS.2 推論優化
Poolside 與 Red Hat AI 已針對高效能代理編碼(agentic coding)與長程軟體任務優化了 Laguna XS.2 模型。透過將 Laguna XS.2 整合至 vLLM,並實作 DFlash 投機解碼(speculative decoding)與 LLM Compressor 量化,團隊在不犧牲生成品質的情況下,降低了推論延遲並提升了運作效率。
一流的 vLLM 整合
Laguna XS.2 已作為一等公民直接整合至 vLLM 中。此整合讓開發者能夠立即使用標準 vLLM APIs 部署該模型,確保與現有的生產環境推論管線無縫相容。
透過 DFlash 投機解碼加速推論
Red Hat AI 利用 Speculators 函式庫為 Laguna XS.2 訓練了一個 DFlash 投機模型,在不損失生成品質的前提下,將 token 生成速度提升了 2-3 倍。
DFlash 的技術實作
DFlash 演算法允許一個僅 5 層、0.6B 的草稿模型(draft model),利用來自目標模型 Laguna XS.2 的隱藏狀態(hidden state)輸入來預測一組 token 區塊。這些預測的 token 隨後由 Laguna XS.2 在單次前向傳播(forward pass)中進行驗證。如果 token 被接受,其產出速度將顯著快於標準的自回歸(autoregressive)生成。此驗證過程保證了輸出品質與單獨使用大型模型時完全一致。
訓練方法論
DFlash 投機模型使用以下參數進行訓練:
- Datasets: 來自 Ultrachat 200k SFT 與 Magpie-Align 的 50 萬個樣本。提示詞(Prompts)經過抽樣,並從啟用了思考功能(thinking enabled)的 Laguna XS.2 重新生成回應。
- Training Duration: 使用餘弦退火排程器(cosine scheduler)進行 6 個 epoch。
- Learning Rate: 最大學習率為 6e-4。
- Sequence Length: 8192。
- Sampling: 每個序列隨機抽取 3072 個區塊位置。
此配置允許 5 層草稿模型在單次前向傳播中預測 8 個 token,透過超越 Eagle-3 範式來提供更快速的並行草稿生成,進而降低 token 間的延遲。
透過 LLM Compressor 量化進行高效部署
為了支援多樣化的硬體與記憶體需求,Poolside 使用 LLM Compressor 函式庫以 compressed-tensors 格式發布了 Laguna XS.2 的量化檢查點(checkpoints)。可用的變體包括:
- FP8
- NVFP4
- INT4/INT8
這些量化檢查點使開發者能夠在 vLLM 中優化硬體利用率、延遲與記憶體消耗之間的平衡,同時維持模型品質。