自適應平行推理:高效推理擴展的下一範式

TL;DR

自適應平行推理(APR)是一種新範式,使大型語言模型(LLMs)能在推理時動態分配平行與串行運算的計算資源。透過讓模型自行決定何時產生獨立的推理執行緒以及如何協調它們,APR 能降低端到端延遲,並防止長序列推理鏈所帶來的「context‑rot」問題。

串行推理擴展的問題

串行推理的擴展與探索量呈線性關係,導致三大主要瓶頸:

  1. Context‑Rot:隨著模型產生更多中間探索路徑,辨別有用資訊與干擾資訊變得更困難,性能下降。
  2. 延遲:生成時間與推理長度成正比,對於複雜任務有時會出現數十分鐘甚至數小時的等待時間。
  3. 計算密集度:隨著輸出序列長度的擴展,推理變得更慢且可靠性降低。

平行推理透過允許模型獨立(不依賴彼此的上下文)且同時(同時執行)探索多條執行緒,解決了上述問題。

從固定平行度到自適應控制

雖然先前已有平行推理方法,但它們通常依賴模型外部施加的結構。APR 將此控制權移交給模型本身。

非自適應方法的限制

  • 簡單的 Fork‑and‑Join(Self‑consistency、BoN):因為軌跡是獨立抽樣,常會產生冗餘計算。
  • 基於啟發式的結構化搜尋(Tree/Graph/Skeleton of Thoughts、MCTS):需要事先了解分解策略,對所有問題未必適用。
  • 固定階段變體(ParaThinker、GroupThink、Hogwild! Inference):無論問題是否受益,都強制使用特定的平行結構。

APR 的優勢

自適應平行推理允許模型根據問題複雜度決定平行化程度,帶來三大關鍵好處:

  • 無領域特定啟發式:模型透過強化學習(RL)學習通用的分解策略,發現如同時自我驗證等新興模式。
  • 降低冗餘:模型在分支前能產生唯一且不重疊的子任務,與 Best‑of‑N(BoN)不同。
  • 動態分配:對於簡單問題模型可以選擇不平行化,避免不必要的平行化開銷。

自適應平行性的推理系統

執行自適應平行分支通常遵循 fork‑join 設計:模型將問題分叉為同時執行的子任務,然後再將結果合併為最終答案。主要的技術挑戰在於於 KV cache 層面聚合結果。

引擎修改式方法(Multiverse)

Multiverse、Parallel‑R1、NPR 等方法會修改推理引擎,將來自獨立執行緒的 KV cache 非連續記憶體區塊複製並拼接。

  • 取捨:此方式避免了第二次 prefill,但會帶來系統脆弱性(例如指標錯誤或快取驅逐)以及位置編碼的分布轉移,需大量訓練並修改注意力遮罩以校正行為。

引擎無關式方法(ThreadWeaver)

ThreadWeaver 將協調工作移至客戶端。客戶端負責將獨立分支的文字輸出串接,然後引擎執行第二次 prefill 以產生最終結論的 KV cache。

  • 取捨:在 prefill 階段會產生一些計算冗餘,但因為 prefill 相較於解碼成本顯著更低,仍保持高效。此方式不需修改引擎,且可使用標準因果注意力,較易將順序模型套用於平行化。

訓練與獎勵設計

教導模型使用平行控制流標記需要示範資料與特定的激勵結構。

示範與 SFT

監督式微調(SFT)用於教授平行控制流的語法。目前仍在討論 SFT 是產生新推理能力,還是僅將既有能力對齊至特定標記語法。

獎勵機制

僅以結果正確度作為獎勵往往不足以激勵平行化。研究者探索了多種獎勵設計:

  • 僅結構獎勵:獎勵執行緒數量或正確使用結構,模型容易「濫用」產生無用執行緒。
  • 關鍵路徑獎勵:為了優化延遲,獎勵聚焦於關鍵路徑(最長的因果相依 token 序列)。ThreadWeaver 使用的獎勵為 $1 - L_{\mathrm{critical}} / L_{\mathrm{total}}$,隨著關鍵路徑佔總 token 比例變小而提升。
  • 正確性門檻:為防止獎勵低效但錯誤的路徑,平行化獎勵僅在最終答案正確時發放:$R = \mathbf{1}(\text{Correctness}) + \mathbf{1}(\text{Correctness}) \times (\text{parallelization metric})$。

效能與未解問題

APR 的評估依目標而異。Multiverse 與 ThreadWeaver 偏重於準確度與延遲,NPR 則關注 Genuine Parallelism Rate,Parallel‑R1 把 APR 作為 RL 前的探索腳手架,以提升訓練後的效能。

尚存挑戰

  • 推理 vs. 訓練:尚不清楚推理時的平行化是否能持續提升準確度,或其主要價值在於作為訓練時的探索腳手架。
  • 穩定性:若平行化獎勵放寬,模型往往會回退至串行推理。
  • 硬體感知:未來的訓練可根據可用的計算預算,使平行化決策具備硬體感知能力。
  • 平行深度:目前的結構多為平面;透過遞迴語言模型(RLM)探索深度大於 1 的遞迴平行化是可能的下一步。

Sources