自我提升 AI Agent 驗證方法概覽
訓練驗證器以解決數學文字題 (OpenAI 2021)
核心重點是,訓練一個能預測完整解答正確性的驗證器,在結合重複採樣時可以提高答案選擇的準確度,特別是隨著驗證器訓練集的增長。 該論文介紹了 GSM8K 資料集,包含 8,500 個需要多步推理和自然語言解答的小學數學問題。 為了訓練驗證器,作者在 GSM8K 的一部分上對語言模型進行了兩個 epoch 的微調,然後針對每個問題生成 100 個完成項,使用人類提供的最終答案將每個完成項標記為正確或錯誤,並在這些標記數據上訓練驗證器一個 epoch。 驗證器架構是一個帶有標量頭 (scalar head) 的語言模型,它會針對每個 token 輸出一個二元預測;在測試時,使用最後一個 token 的分數來對完成項進行排名,並挑選分數最高的那個。 消融研究顯示,當驗證器看到超過約 1,000 個標記樣本時,驗證效果會優於純監督式微調,且較大的生成器搭配較小的驗證器通常比反過來效果更好。 增加每個問題的完成項數量可以提高準確度,直到約 400 個樣本左右;超過這個數量後,驗證器的精確度會下降,因為它無法區分競爭激烈的正確與錯誤答案。
Let's Verify Step by Step (OpenAI)
主要結論是,過程監督獎勵模型 (PRM) 比結果監督獎勵模型 (ORM) 提供更細粒度的信用分配 (credit assignment),且對幻覺更具魯棒性,特別是在有人類標記的逐步正確性時。 作者創建了 PRM800K 資料集,其中包含 800,000 個針對模型生成的推理鏈的人類標註逐步標籤。 對於 ORM 訓練,他們使用最後一個 token 的分數作為獎勵;對於 PRM 訓練,他們將每一步的機率相乘以獲得序列級別的獎勵。 在 GSM8K 上的實驗顯示,PRM 優於 ORM 和多數決投票,能正確識別 ORM 會錯過的稀有正確解答,且 PRM 從額外標籤中獲得的益處比 ORM 更多。 過程監督減少了偽陽性 (false positives),因為模型無法透過錯誤的推理路徑得出正確的最終答案來獲得高獎勵;逐步標籤會懲罰這種捷徑。 作者指出,結合 PRM 和 ORM 信號可以捕捉兩者的優點,但會引入一個必須進行調優的閾值超參數。
Math-Shepherd: 自動化逐步標註
關鍵結果是,逐步標籤可以透過估計每一步透過採樣來達到正確最終答案的潛力,從而自動生成,而無需人類標註,且這種自動化 PRM 可以用作強化學習的獎勵模型,以進一步提升生成器。 給定一個當前的推理步,該方法會採樣 N 個後續項;「硬估計」(hard estimate) 標記該步為成功,如果任何一個後續項達到了正確的最終答案,而「軟估計」(soft estimate) 則使用成功後續項的比例。 作者發現,當 N = 4 時,硬估計和軟估計的表現相似,因此他們選擇了硬估計以求簡便。 使用這些自動生成的標籤,他們訓練了一個 PRM,然後應用 PPO 來針對 PRM 微調生成器 (例如 Mistral-7B),與使用基於 ORM 的獎勵相比,在 GSM8K 上實現了更高的準確度,並在更具挑戰性的 MATH 資料集上獲得了更大的增益。 該方法也適用於自洽性 (self-consistency, 即多數決投票) 基線,顯示出學習到的 PRM 提供比簡單的投票基於選擇更強的信號。
Weaver: 弱驗證器集成 (Ensemble)
核心發現是,將許多不完美的驗證器透過弱到強監督 (例如 Naive Bayes 或 logistic regression) 結合起來,可以產生一個顯著更強的強驗證器,且產生的集成模型可以被蒸餾成一個小模型,該模型在保留大部分準確度的同時,使用遠少於測試時的計算量。 Weaver 將每個驗證器 (PRM, ORM, LLM judge, 等) 視為為候選解答提供一個帶有噪聲的標籤;在假設驗證器錯誤是獨立的假設下,它從一個小的標記樣本集來估計驗證器準確度,並計算最佳權重以結合他們的得分。 n低品質的驗證器會在加權前被過濾掉。 在 GPQA Diamond, MATH, 和 MLU Pro 等高難度基準測試上,對於一個 8B 參數的生成器,加權集成模型將準確度從僅僅略過 40% 提升至 70% 以上,其表現與 o3-mini 等大模型相當;擴展到 Head 70B 生成器時,平均準確度提升至 86.2%。 將加權集成模型蒸餾成一個 400-million 參數的模型可以保留集成模型 97% 的準確度,同時將測試時計算量減少 99% 或更多。 所有檢查點 (checkpoints) 都已開源,可用於 Agentic 或 test-time scaling 專案。