推理前沿:10×更快的模型至自我優化AI — Baseten 演講摘要
處理 200 K‑Token 提示
當一個 200 000‑token 請求到達時,系統首先檢查提示(或其部分)是否曾經出現過以重複使用快取的 KV 快取;如果不是,則將請求路由到一個預填充工作器,該工作器會建立 KV 快取並返回第一個 token,然後將快取傳遞給另一組 GPU 進行解碼。
快取感知路由與分離的預填充/解碼
快取感知路由會選擇具有可用預填充工作器且理想地擁有某些已快取輸入的實例,以便至少能跳過部分 token 的預填充。將預填充與解碼分離意味著一組 GPU 專門處理輸入並構建 KV 快取,而另一組則執行解碼以迭代生成 token。
投機解碼
一個小型投機模型會執行幾次極端積極的前向傳遞來預測多個 token;然後主模型在單次前向傳遞中驗證這些預測。被接受的投機 token 會串流傳送給使用者,降低解碼延遲。投機模型是特定於流量的;對於程式碼工作負載,它能達到高草稿 token 接受率。
量化與誤差抵消
雖然量化會帶來損失,但速度會提升。主要的損失優化是量化;為了保持保真度,需要選擇哪些層進行量化並進行校準以控制異常值。量化誤差可以相互抵消:對某些層進行量化可能產生的誤差會抵消其他層的誤差,從而得到比量化較少層時更高保真度的模型。這使得在 NVFP4 下能夠在保持或提升品質相較於其他量化版本的情況下,實現 20% 的額外吞吐量。
實現最高 10× 更快的推理
從一個未經優化的兆參數模型基線約每秒 30–40 個 token 開始,堆疊技術如量化(每步約 30‑40 % 的提升)、2× 投機器、分離的預填充/解碼(約 2×)以及更好的核心/運行時,可產生 8× 或更高的加速。在足夠的流量和硬體條件下,相對於 naive 部署,可實現 20%、100% 或甚至 200% 的提升,端到端的加速最高可達 10×。
NVIDIA Dynamo 與 KV‑感知路由
Dynamo 是 NVIDIA 的開源程式庫,用於在叢集中移動 KV 快取;它是開發者工具包,而非即插即用的優化器。KV‑感知路由利用 Dynamo 將 KV 快取放置於所需位置,支援分離並減少節點間快取傳輸造成的延遲。
模型並行、自動調校與巨型核心
張量並行會在需要高頻寬互連的 GPU 上切分模型;專家並行則在每個 GPU 上放置完整的專家並複寫路由器,以降低 GPU 間通訊。管線並行僅在模型超出單節點記憶體時使用,迫使多節點分割。自動調校會掃描執行緒數量、共享記憶體和並行配置,以實證方式尋找最佳延遲/吞吐量權衡。巨型核心(融合多種操作)難以編寫,且常常比模組化核心慢,因為啟動開銷和優化損失往往超過其帶來的好處。
硬體趨勢:Rubin、GPU 與 ASIC
未來的 GPU 如 Rubin 會著重於更快的 CPU‑GPU 與 GPU‑GPU 互連,使得 KV 快取卸載和系統層級優化變得更為重要。雖然 GPU 正在獲得類似 ASIC 的張量核心和專用指令,但它們仍然是可編程的;將模型權重完全燒入矽晶片將阻礙微調、量化和新檢查點,因此一種專業化的光譜比純粹的 ASIC 轉變更為現實。
影片生成的挑戰
生成連貫的長格式影片會面臨二次方注意力瓶頸:在 16 fps 和 480p 下,即使只有五秒的影片也涉及約 35 000 個 token,對於較長的片段會導致對數百萬個 token 的注意力。對如此長序列的完整注意力在計算上不可行,這推動研究朝向稀疏/時空注意力或自回歸影片模型。目前的開源自回歸影片模型存在品質漂移問題,而擴散模型在規模上仍受限於閉源替代方案如 Veo 或 Kling。
持續學習與自我優化模型
持續學習可以透過更新模型權重或 KV‑cache 壓縮來實現;後者能在不改變權重的情況下保留知識,使得推理時學習成為可能。GLM‑5.2 展示了自我優化:它被用來分析自身的推理,找出瓶頸核心,編寫新核心,並重複此循環,Baseten 推理引擎中的某些 GPU 核心正是由 GLM‑5.2 本身編寫的。這說明了一個迴圈,即模型協助優化運行它們的基礎設施。
結語
推理工程正從單純讓模型快速運行,演變為一個涵蓋核心、硬體互連、模型設計及持續學習的系統問題。隨著模型規模增大和硬體進步,擠出另一個 10×、100× 或甚至 1000× 的推理效能競賽將持續下去,這將由更快的網路、更好的 KV‑cache 管理以及能夠改進自身服務堆疊的模型所驅動。