Stanford CS329A 自我改進 AI Agent 未來研究領域講座摘要
這場講座指出了推進自我改進 AI Agent 的四個關鍵研究前沿:提高推理鏈的多樣性、強化驗證迴圈、使模型能夠提出自己的訓練任務,以及提升以每瓦智能度(intelligence per watt)衡量的推理效率。
推理鏈的多樣性(多 Agent 細調)
使用單一語言模型生成合成數據會導致推理鏈的變異量較低,導致性能在幾次細調迭代後進入平台期。多 Agent 細調(Multi-agent fine-tuning)透過採用數個專門的生成 Agent,使其能產生多樣化的初始解法,並使用評論 Agent(critic agents)來評估與改進這些解法。在迭代過程中,生成 Agent 會在產生下一個回應之前總結同儕輸出,而評論 Agent 則學習區分正確與錯誤的答案。這個過程免費提供了類似多數決的樣態多樣性,並允許在數學基準測試(例如 Llama 展現了響應性)以及遷移至相鄰數據集(如 GSM-8k)時持續獲得性能增益,且在 GSM-8k 上的準確度不會像單 Agent 細調那樣崩潰。
驗證與元驗證(DeepSeekMath-V2)
僅依賴結果獎勵模型無法捕捉到有缺陷的推理鏈,特別是在定理證明中,正確的最終答案可能會隱藏無效的步驟。DeepSeekMath-V2 引入了一個驗證器(verifier),它學習在沒有參考解答的情況下檢測證明中的問題,以及一個元驗證器(meta-verifier),用來判斷驗證器所識別的問題是否真實存在。人類負責標註有問題的證明;驗證器被訓練來對證明進行 0.5-1 的評分;元驗證器則評估驗證器的分析。透過迭代這個迴圈,證明分數會提升:在八次迭代後分數上升,且從 32 個生成的證明中選擇最佳者,在 2024 年 IMO shortlist 上達到了約 42%。生成器學習傾向於選擇更高質量的證明,從而打破了驗證瓶頸。
自生成任務課程(Absolute Zero)
隨著模型超越人類專家知識,策劃提示詞(prompts)與驗證任務變得成為瓶頸。Absolute Zero 讓單一模型能夠同時提出並解決自己的任務。提出者(proposer)根據過去的範例來建立溯因、演繹與歸納的編碼任務,以促進多樣性,並根據任務難度(1 - 成功率)獲得獎勵,目標是針對解決者有時成功、有時失敗的中等難度任務。提出的任務透過執行、安全性檢查與確定性輸出檢查來進行驗證,並使用一個種子三元組緩衝區來支持課程學習(curriculum learning)。結果顯示,在沒有任何人類策劃的提示詞數據的情況下,卻展現了最先進的編碼性能,表現優於在數萬個專家範例上訓練的模型,且隨著時間推移,複雜度與多樣性不斷增加,並能遷移至數學基準測試;較大的模型受益更多。
每瓦智能度效率增益
每瓦智能度(intelligence per watt)被定義為平均任務準確度除以解決任務所需的平均功耗,使用主動參數 $\le$ 20B 的本地模型。自 2023 年以來,聊天機器人查詢的比例中,可由這類模型解決的比例提升了 3.1 倍,達到真實世界查詢的 88.7%。硬體效率進一步貢獻了 1.7 倍,兩年內總計實現了 5.3 倍的每瓦智能度增益。雖然本地加速器(例如 Apple M4 Max)落後於企業級晶片如 B200(每瓦智能度約低 1.5 倍),但趨勢顯示,越來越多的推理可以轉移到邊緣設備。
開放研究問題
- 持續學習:如何以在線(online)方式將解決問題的正向與負向經驗整合進模型權重或記憶中,而不是依賴離線細調,可能透過長期記憶系統、海量上下文窗口或知識庫緩存。
- 測試時擴展基礎設施(Test-time scaling infrastructure):需要針對重複採樣、工具調用與推理時的搜索,進行優化的系統,基於 hydrogen token SRS 等研究成果,處理高吞吐量、低延遲的工作負流。
- 混合本地-雲端推理:開發動態分配流量於本地與雲端模型之間的路由機制,根據查詢複雜度來分配,並同時開發針對本地加速器的節能型內核(kernels)。
- 非驗證領域:在晶片設計或科學模擬等領域,其中地面真值(ground-truth)驗證速度慢或成本高,訓練獎勵模型來從離線數據預測模擬結果,但需承認模型的泛化性依賴於數據覆蓋範圍且存在不準確的風險。
這些研究方向直接源於講座對目前自我改進 AI Agent 的局限性與新興機會的分析。