訓練時間縮放與強化學習縮放,用於自我改進的 AI 代理
訓練時間縮放概述
訓練時間縮放的核心思想是使用模型自身的輸出,根據正確性進行過濾,然後在這些過濾後的輸出上進行微調,從而用計算資源取代模型參數。這會形成一個循環:生成的解答會被驗證,若正確則保留並用於進一步改進模型。該循環在擁有強驗證器的領域中效果最佳,例如數學推理或程式碼執行,因為最終答案可以自動檢查。
STaR:啟動理性鏈
STaR(Self‑Taught Reasoner)透過從少量問題‑理由‑答案範例開始,為更多問題產生答案,僅保留答案正確的樣本,對錯誤嘗試給出正確答案作為提示並要求模型產生理由,來啟動理由鏈。接著模型在收集到的理由和答案上進行微調,該過程可以重複迭代。正如逐字稿所述,「STaR 的關鍵見解非常簡單」——它將最終答案的正確性視為理由品質的代理,並假設在得到答案作為提示時,模型能夠產生有效的理由。在 GPT‑J(6 B)上的實驗顯示,在 CommonsenseQA 上的表現有所提升(僅使用標準監督微調所需資料的 86% 即達到 72.5 % 準確率),但在 GSM8K 上收益甚微,因為直接在優質資料上微調的表現相近。STaR 在幾次迭代後會達到平台期,因為它不是完整的強化學習方法。
DeepSeekMath 與 GRPO
DeepSeekMath 從程式碼預訓練模型出發,從 Common Crawl(OpenWebMath)策展數學數據,並應用 Group Relative Policy Optimization(GRPO)。GRPO 用群體基礎的優勢估計取代 PPO 中的評論家和價值函數:對每個問題,採樣多個答案,由獎勵模型評分,優勢計算為 (reward − mean reward) / stddev reward。這僅需要三個模型副本,而 PPO 需要四個,因此記憶體使用更高效。在較簡單的數學基準(非 AIME)上,DeepSeekMath 使用 7 B 模型將準確率從 46.8 % 提升至 51.7 %。提升體現在 majority‑at‑K 指標上,而 pass‑at‑K 沒有增加,這表示模型在多次樣本中的一致性變好,而非根本問題解決能力的飛躍。
DAPO:穩定長鏈推理的強化學習
DAPO 解決在將 GRPO 應用於長鏈思考推理時出現的三個不穩定問題:熵崩塌、響應長度失控以及噪聲截斷輸出。它引入了非對稱裁剪(允許增加幅度大於減少幅度的 PPO 裁剪)、動態採樣(過濾掉所有獎勵為零或全為一的群體,以保留有用的梯度信號)、詞元級損失(根據詞元數量加權損失,而非將每個序列視為同等重要)以及對過長詞元的逐步懲罰,以抑制失控生成。在 Qwen‑32B 模型上應用於 AIME 基準:基線 GRPO 大約給出 30 % 準確率;加入過長過濾後提升至 36 %,非對稱裁剪提升至 38 %,軟過長懲罰提升至 41 %,詞元級損失提升至 42 %,動態採樣提升至約 50 %。與前面的方法類似,提升主要體現在 majority‑at‑K 表現上,而非 pass‑at‑K。
在 AIME 與推理基準上的結果
該講座對比了傳統的參數縮放觀點與訓練時間縮放的結果:具有 175 B 參數的模型(GPT‑3.5)在 AIME 上僅得到約 5 %,而使用 DeepSeekMath 訓練的 7 B 模型達到 51.7 %(透過額外技巧可達 60 %),以及使用 DAPO 訓練的 32B 模型達到約 50 %。這些結果表明,投入計算資源來生成和過濾推理跡象可以替代模型規模,但主要效果是提升多樣本間的一致性(較高的 majority‑at‑K),而非解決先前無法解決問題的能力(pass‑at‑K)。
未解問題與限制
講座最後提出幾個開放的研究方向:為何 majority‑at‑K 會提升而 pass‑at‑K 不會;如何從失敗嘗試中學習而非直接過濾掉它們;當數據稀缺時如何獲得足夠的驗證信號(例如使用驗證器集合);以及是否結合 STaR‑式理由生成與 DAPO‑式強化學習穩定技術能帶來更大收益。同時指出,訓練時間縮放仍依賴強獎勵信號和驗證器,且該方法尚未教會模型在已知格式之外的全新問題類型上泛化,僅能提升已知格式的一致性。