Stanford CS329A Self-Improving AI Agents – 課程概覽 (Fall 2025)
定律與新興能力
講座表明,增加模型參數、訓練計算和資料集大小會持續降低測試損失,這是 GPT‑2 到 GPT‑4 性能提升的基礎。
- 當模型規模從 BERT (~340 M) 增長到 GPT‑2 (1.5 B)、GPT‑3 (175 B)、PaLM (540 B) 以及估計的萬億參數 GPT‑4 時,測試損失會下降,從而產生更好的語言模型。
- 較大的模型表現出 few‑shot 和 zero‑shot 學習:模型可以在不進行顯式微調的情況下,遵循任務描述或少量範例。
- 新興推理僅在較大的模型中出現;當模型足夠大時(例如 LaMDA、GPT、PaLM 在 ≥8 B 參數時),鏈式思考提示能提升數學和推理任務的表現。
- 這些擴展趨勢激發了對指令調整和基於人類反饋的強化學習的進一步研究,以將原始語言模型轉變為可用的助手。
指令調整與基於人類反饋的強化學習
指令調整和 RLHF 是將基礎模型轉變為如 ChatGPT 這樣系統的關鍵步驟。
- 在完成下一個標記預測的預訓練後,模型會在高質量的監督數據(書籍、論文)上進行微調,以提升一般語言能力。
- 指令調整提供問答對(可選擇性地附帶鏈式思考),使模型學會遵循指令並產生答案。
- RLHF 從人類對模型輸出的排名中構建獎勵模型;然後對模型進行優化以最大化此獎勵,使輸出符合人類偏好,如正確性、有益性或無害性。
- 預訓練 → 高質量微調 → 指令調整 → RLHF 的組合產生了 ChatGPT 中看到的能力,超越了早期的模型如 GPT‑3。
推理時間擴展(大型語言猴子)
推理時間擴展可以在不改變模型參數的情況下解鎖額外能力。
- 大型語言猴子項目對給定問題的模型輸出進行重複採樣,並使用驗證器選擇正確答案,這類似於無限猴子定理。
- 實驗將每個問題的採樣數從 1 增加到 10,000,在數學和編程基準上;原本單次採樣時弱於 GPT‑4o 的模型在允許多次採樣時超越了它。
- 這表明模型已經知道比單次貪婪解碼所揭示的更多;推理擴展(例如重複採樣、樹搜索)可以提升 pass‑@k 或覆蓋率指標。
- 該方法具有樣本效率:適量的並行採樣即可得到正確答案,且可通過並行生成來減輕延遲。
- 當驗證器不可用時,研究者會探索 LLM‑as‑judge 或學習到的獎勵函數來提供反饋。
- 將推理時間擴展與合成數據生成結合,能夠實現自我改進循環:模型產生候選解決方案,驗證器篩選它們,然後篩選後的數據用於進一步微調模型。
從 LLMs 到代理工作流程
課程超越單輪聊天機器人,進入能夠透過工具使用、規劃和自我糾正來完成多步驟目標的代理。
- 代理與聊天機器人的區別在於它們會維持目標、規劃行動、與外部工具互動(例如網路搜尋、程式碼執行),並利用反饋進行調整。
- 工作流程模式包括提示鏈(子任務排序)、路由(簡單 vs. 複雜路徑)、並行化(對不同輸同時進行 LLM 呼叫)以及協調者‑工作者(一個規劃 LLM 分派工作者 LLM)。
- 驗證器(單元測試、基於規則的檢查器)和評論者(LLM‑as‑judge)提供自我糾正和回溯的反饋。
- 討論的範例包括 Claude Code(用於編程協助)和深度研究工具(用於端到端文獻合成),兩者都依賴上述模式。
- 有效的代理需要強大的規劃、多步驟推理,以及根據工具輸出或驗證器信號修改步驟的能力。
課程後勤
課程結構、評估和期望如下所述。
- 先修條件:對機器學習基礎和深度學習有基本了解(如課程網站所列)。
- 教材:講座投影片、閱讀材料和影片會發布在 Canvas 和公開網站 cs329a.stanford.edu 上。
- 評估:三項作業(佔成績 50%)和一個課程專案(佔成績 50%)。
- 作業時間表和截止日期可在 Canvas 查看;依照公布的政策允許遲交天數。
- 專案可以個人完成,或由最多四人組成的團隊完成;將提供 API 點數。
- 里程碑:專案提案(早期十月)、中期報告(提案後兩週)、最終報告和海報展示(12 月 12 日,下午 4 點至 6 點)。
- 專案應該是研究導向的(假設驅動,而不僅僅是應用程式);過去的專案曾帶來會議論文發表。
- 辦公時間和問答將透過 Ed(公開論壇)和 Gradescope(用於提交)處理。
- 講座影片最終將發布在 YouTube 上,僅供旁聽觀看(不計學分)。