Intel Gaudi 輔助生成支援

Hugging Face 已將輔助生成(亦稱投機抽樣)整合至 Optimum Habana 函式庫,以加速在 Intel Gaudi 處理器上的文字生成。此最佳化可降低大規模生成式 AI 實作的推論延遲、基礎設施成本與功耗。

透過投機抽樣的輔助生成

輔助生成透過使用較小的草稿模型預測多個 token,然後再由較大的目標模型驗證,以加速文字生成。此過程遵循特定循環:

  1. 草稿:草稿模型產生 $K$ 個 token。
  2. 評估:目標模型評估這 $K$ 個 token。
  3. 校正:若草稿模型的 token 被拒絕,目標模型會產生下一個正確的 token。
  4. 迭代:此過程重複,重新以草稿模型產生接下來的 $K$ 個 token。

此技術因在投機抽樣過程中恢復目標分佈,故能維持與標準自回歸抽樣相同的抽樣品質。影響此方法效能的主要因素為草稿模型相對於目標模型的大小以及草稿 token 的接受率。

在 Intel Gaudi 上的技術實作

在 Intel Gaudi 上實作輔助生成需要針對不同規模的模型管理各自的最佳化策略。具體而言,實作利用 KV 快取與量化模型,且每個模型(草稿與目標)皆保有獨立的 KV 快取,以因應其尺寸差異。

此功能現已納入 Optimum Habana,該套件擴充了 Hugging Face 的 Transformers 與 Diffusers 等函式庫,確保 AI 工作流程在 Intel Gaudi 硬體上得到完整最佳化。

效能與使用方式

輔助生成通常可為大型 transformer 模型帶來約 2 倍的加速。草稿模型的實際接受率——亦即最終的加速幅度——在一定程度上取決於輸入文字。

使用者可在 Hugging Face Transformers 函式庫的 .generate() 呼叫中使用 assistant_model 參數來啟用此功能。在 Optimum Habana 環境中,則可透過文字生成範例中的 --assistant_model 命令列參數觸發。

硬體背景

Intel Gaudi 處理器被定位為高效能推論的具成本效益替代方案。根據 Hugging Face 的說法,Intel Gaudi 的效能與 Nvidia H100 GPU 相近,同時價格與 Nvidia A100 80GB GPU 相當。

Sources