Stanford CS329A:測試時期計算規模化於 AI 代理人

測試時期計算規模化概述

測試時期計算規模化允許 AI 模型在不更改模型參數或進行額外微調的情況下提升效能。傳統的大型語言模型(LLM)開發側重於預訓練(高計算、長時間)與微調(較低計算),而測試時期規模化則將計算預算轉移至推論階段,以從現有模型中獲得更佳回應。

平行抽樣與覆蓋率的冪律

重複平行抽樣指的是對同一輸入問題多次向模型提問,並使用驗證器挑選正確回應。此方法可讓較小、較劣的模型(例如 Llama 3‑8B)在特定任務上超越較大、專有的模型(例如 GPT‑4o)。

推論的規模律

研究顯示 覆蓋率(至少有一個抽樣解決的問題比例)與 抽樣次數 (k) 之間的關係遵循指數冪律。這讓工程師能預測在不同模型規模與領域下,要達成特定覆蓋目標所需的資源。

困難問題的長尾

此冪律行為源自問題難度的分布。大多數問題在 "pass@1" 時即可解決,但仍有一條 "長尾" 的複雜問題,模型僅能偶爾解出。增加抽樣次數會提升在最難問題上命中稀有正確解的機率。

生成‑驗證鴻溝

雖然模型常能在大量抽樣中產生正確答案,但辨識該答案本身是一項獨立挑戰,稱為 生成‑驗證鴻溝

可驗證與不可驗證領域

  • 可驗證領域: 在程式碼(透過單元測試)、數學(透過形式證明)或語言翻譯(透過等價性檢查)等領域,存在完美或近乎完美的驗證器。例如,在 CUDA 程式碼生成中,可透過將輸出與原始 PyTorch 程式碼的輸出比較來驗證。
  • 不可驗證領域: 在缺乏自動驗證器的領域,常使用 多數投票(選擇最常出現的答案)的方法,但此方法往往很快就會停滯,且無法捕捉到困難問題的稀有正確答案。即使是基於 LLM 的獎勵模型,也常在當前驗證能力與模型實際覆蓋率之間留下顯著鴻溝。

優化測試時期計算:平行 vs. 連續

除了簡單的重複抽樣外,計算還可以透過連續修訂與導向搜尋來擴展。

連續修訂

與其平行嘗試,模型先產生初步方案,然後逐步修訂。此連續方式讓模型能從不同角度審視問題並精煉其推理。

結果 vs. 過程獎勵模型

  • 結果獎勵模型(ORM): 為回應的最終答案打分。
  • 過程獎勵模型(PRM): 為生成過程中的每一步打分。PRM 可用於指導 束搜索,模型僅根據逐步分數擴展最有前景的推理路徑。

預訓練 vs. 測試時期規模化

對於簡單與中等難度的問題,提升測試時期計算往往比增加預訓練 token 更具計算效率。然而,對於最困難的問題,仍然較大且預訓練更廣的模型即使在大量測試時期計算下仍保持性能優勢。

Archon:推論時期架構搜尋

Archon 是一個將推論規模化視為架構設計問題的框架,利用貝葉斯最佳化器在給定計算預算下找出模型與技術的最佳組合。

推論時期操作

Archon 使用多項關鍵操作:

  • 生成(Generation): 從一個或多個 LLM 進行標準抽樣。
  • 融合(Fusion): 請 LLM 基於多個候選回應合成單一最終答案。
  • 評論家(Critic): 使用模型描述回應的優缺點。
  • 排序器(Ranker): 提示模型依品質對候選項目排序。
  • 單元測試生成(Unit Test Generation): 產生測試以驗證解答的正確性。

Archon 的關鍵發現

  • 深層架構: 堆疊多層評論、排序與融合(形成 "深層" 推論架構)可顯著提升準確度。
  • 效能提升: 透過最佳化這些架構,開源模型可匹敵或超越最前沿的閉源模型。Archon 報告在推理、數學與程式碼任務上,平均 提升 14.1% 的 pass@1 準確率,相較於 GPT‑4 與 Claude 3.5 Sonnet。
  • 泛化能力: 為特定任務最佳化的架構亦可設計為通用系統,在多樣化基準測試中表現良好。

This lecture explores how increasing compute during inference—through parallel sampling, sequential revision, and architecture search—can significantly improve LLM performance without additional training.

— @handle

Sources