EAGLE 3.1 版本說明:提升推測解碼的韌性與效率
EAGLE 3.1 版本說明:提升推測解碼的韌性與效率
EAGLE 3.1 引入架構改進以解決注意力漂移,在長上下文工作負載中將可接受長度提升至兩倍,並透過 vLLM 與 TorchSpec 整合顯著提升吞吐量。
EAGLE 3.1 版本說明:提升推測解碼的韌性與效率
透過架構改進解決注意力漂移
為了解決稱為「attention drift」的效能下降現象,EAGLE 3.1 針對隨著推測深度增加而使 drafter 將注意力從 sink token 轉移至自身生成的 token 的問題進行了處理。此不穩定性主要由兩個因素造成:融合輸入表示不平衡,使較高層的隱藏狀態佔主導,以及未正規化的殘差路徑導致隱藏狀態幅度不斷增大。
為了緩解這些問題,EAGLE 3.1 實作了兩項關鍵的架構變更:
- FC Normalization:在每個目標隱藏狀態之後、FC 層之前加入 Fully Connected(FC)正規化。
- Post-Norm Hidden-State Feedback:將 post-norm 隱藏狀態回饋至後續的解碼步驟。
這些修改使 drafter 的行為更接近於在解碼步驟間遞迴呼叫,而非僅僅將層疊加至目標模型。此舉提升了對聊天模板與系統提示變化的韌性、加強了長上下文的穩健性,並在訓練階段到推論階段之間提供更佳的外推能力。
透過 TorchSpec 與 vLLM 進行訓練與部署
TorchSpec 訓練支援
TorchSpec 現在提供針對 EAGLE 3.1 的高效訓練支援,降低訓練開銷並簡化實驗工作流程。作為此管線的示範,已開源一個用於 Kimi K2.6 的 EAGLE 3.1 草稿模型。
vLLM 整合
EAGLE 3.1 以設定驅動的方式擴充 vLLM 中現有的 EAGLE 3 實作。此整合支援 FC 正規化、post-norm 隱藏狀態回饋,並移除對目標隱藏狀態的硬編碼假設。
與 EAGLE 3 checkpoint 的向後相容性完整保留,允許草稿模型插入現有的 speculative-decoding 程式路徑。此支援已在 vLLM 主分支、nightly 版本以及即將推出的 v0.22.0 版本中提供。
效能基準測試
在 SPEED-Bench 程式碼資料集上使用 Kimi K2.6 EAGLE 3.1 草稿模型(於 Kimi-K2.6-NVFP4 搭配 vLLM 執行,TP=4,GB200,未分割)進行的基準測試顯示出顯著的吞吐量提升:
- Concurrency 1:相較於無推測基線,每位使用者的輸出吞吐量提升 2.03 倍。
- Concurrency 4:吞吐量提升 1.71 倍。
- Concurrency 16:吞吐量提升 1.66 倍。
生態系統合作
EAGLE 3.1 的開發是由 EAGLE 團隊(演算法研究)、vLLM 團隊(生產推論最佳化)與 TorchSpec 團隊(訓練基礎設施)共同合作完成,GPU 支援由 NVIDIA 提供。