Stanford CS329A Lecture 4: Learning from Feedback with Tools/Code – ReAct, RLEF, and Constitutional AI

ReAct: Combining Reasoning and Tool Use

ReAct 顯示,透過提示模型交錯口頭推理痕跡與工具呼叫,可在知識密集任務上獲得更好的落實與更具可解釋性的行為。模型先產生推理痕跡,然後根據該痕跡選擇動作,觀察結果,再重複此迴圈,便能檢索外部資訊(例如透過網路搜尋)並將其納入推理。相較於純粹的 chain‑of‑thought,此方法因模型能對答案進行外部知識庫驗證,從而降低幻覺。在 HotpotQA、FEVER 與 WebShop 上,ReAct 超過僅動作的基線,且結合 chain‑of‑thought 自我一致性或回退機制時,表現更勝標準技術。在 WebShop 決策任務中,ReAct 獲得 66.6 分,而人類專家為 82.1 分,顯示仍有提升空間,但證明了將推理落實於工具使用的價值。

RLEF: Learning Code from Execution Feedback

RLEF(Reinforcement Learning from Execution Feedback)透過將測試執行視為 PPO 訓練迴路中的回饋訊號,提升程式碼生成。模型接收自然語言問題,產生程式碼,於公開測試集上執行以取得即時推論時回饋,並持續迭代直至程式碼通過或達到回合上限。最終解答再於隱藏的私人測試集上評估,其結果作為 PPO 更新的獎勵。此雙層測試策略防止模型僅記憶公開測試的輸出。混合的 token‑turn 級別策略在回合層面計算價值函數,同時逐 token 產生程式碼,提供細粒度的生成控制。於 CodeContests 的實驗顯示解題率提升(例如 k 時的解題率隨訓練提升)且錯誤輸出減少,因模型學會利用執行回饋修復程式碼。測試通過/失敗的二元獎勵已足以應付這類相對較短的競賽程式問題,且此方法可泛化至其他程式碼生成基準。

Constitutional AI: Self‑Critique via Human‑Written Principles

Constitutional AI 透過使用人類撰寫的原則集合(即憲法)作為 AI 產生回饋的來源,訓練模型變得無害。此過程分為兩個階段:首先,模型根據憲法批評自身輸出並進行修正;這些自我批評/修正痕跡用於監督式微調。其次,基於修正後的輸出與憲法訓練偏好模型,該偏好模型在強化學習中指導模型產生既有幫助又無害的回應。結果顯示,無害性 Elo 分數顯著提升,而幫助性可能略有下降;將 Constitutional AI 與 chain‑of‑thought 結合可在幫助性與無害性之間取得最佳的 Pareto 前緣。此方法具備可擴展性,因只需少量後訓練計算即可更新憲法,且避免了標準 RLHF 所需的大規模人工標記。

Discussion: Challenges and Extensions

本次講座指出了多項未解挑戰。對於 ReAct,噪聲或誤導性的環境回饋可透過加入反思層或回溯機制來緩解,且透過重複抽樣與多數投票可提升信心。將 ReAct 擴展至更大的動作空間需要更多示範,且會增加推論成本,顯示需要更有效的動作選擇機制。於 RLEF,二元回饋可能不足以處理複雜的除錯任務;更豐富的錯誤痕跡或可提升修復效率。對於 Constitutional AI,如何在不完全重新訓練的情況下更新憲法仍是持續學習的開放問題,且為防止模型過度依賴自我批評(因可能過度自信),可考慮使用 ensemble‑based 批評。討論亦指出,人類會運用額外的認知機制——任務分解、平行思考、記憶與適應性的推理‑行動比例——這些都可納入未來代理人的設計中。

Sources