Stanford CS329A 自我改进型 AI Agent 课程概览 (Fall 2025)

Scaling Laws 与涌现能力

从讲座中可以看出,增加模型参数、训练计算量和数据集规模会持续降低测试损失,这是从 GPT‑2 到 GPT‑4 性能提升的基础。

  • As model size grows from BERT (~340 M) to GPT‑2 (1.5 B), GPT‑3 (175 B), PaLM (540 B) and estimated trillion‑parameter GPT‑4, test loss decreases, yielding better language models.
  • 随着模型规模从 BERT (~340 M) 增长到 GPT‑2 (1.5 B), GPT‑3 (175 B), PaLM (540 B) 以及估计达到万亿参数的 GPT‑4,测试损失会降低,从而产生更好的语言模型。
  • 更大的模型展现出 few‑shot 和 zero‑shot 学习能力:模型可以在没有显式微调的情况下,通过任务描述或少量示例来完成任务。
  • 涌现推理能力仅出现在较大的模型中;当模型足够大时(例如,LaMDA, GPT, PaLM 在参数量 ≥8 B 时),chain‑of‑thought prompting 可以提高数学和推理任务的性能。
  • 这些 scaling 趋势促使了后续在 instruction tuning 和 reinforcement learning from human feedback 方面的研究,旨在将原始语言模型转化为可用的助手。

Instruction Tuning 与 Reinforcement Learning from Human Feedback

Instruction tuning 和 RLHF 是将基础模型转化为 ChatGPT 等系统的关键步骤。

  • 在进行 next‑token prediction 的预训练之后,模型会在高质量的监督数据(书籍、论文)上进行微调,以提高通用语言能力。
  • Instruction tuning 通过提供问答对(可选包含 chain‑of‑thought)来让模型学习遵循指令并生成回答。
  • RLHF 通过人类对模型输出的排名来构建奖励模型;随后优化模型以最大化该奖励,使输出与人类偏好(如正确性、帮助性或无害性)保持一致。
  • 预训练 → 高质量微调 → instruction tuning → RLHF 的结合,产生了 ChatGPT 所具备的能力,超越了早期的 GPT‑3 等模型。

Inference‑Time Scaling (Large Language Monkeys)

Inference‑time scaling 可以在不改变模型参数的情况下解锁额外的能力。

  • Large Language Monkeys 项目通过对给定问题的模型输出进行重复采样,并使用 verifier 来选择正确答案,这类似于“无限猴子定理”。
  • 在数学和编程基准测试中,将每个问题的样本数从 1 增加到 10,000;在单次采样的情况下,弱于 GPT‑4o 的模型在允许多次采样时表现优于它。
  • 这表明模型已经掌握了比单次 greedy decode 所揭示的内容更多的知识;inference scaling(例如,重复采样、tree search)可以提高 pass‑@k 或 coverage 指标。
  • 该方法具有样本效率:适度的并行采样可以产生正确答案,且可以通过并行生成来缓解延迟。
  • 当 verifier 无法使用时,研究人员会探索 LLM‑as‑judge 或学习到的奖励函数来提供反馈。
  • 将 inference‑time scaling 与 synthetic data generation 结合使用,可以实现自我改进循环:模型生成候选解决方案,verifier 过滤它们,然后过滤后的数据用于进一步微调模型。

From LLMs to Agentic Workflows

本课程将从单轮对话聊天机器人转向能够使用工具、进行规划并进行自我纠正的 Agent 任务流。r

  • Agents 与聊天机器人不同,它们通过维持一个目标、规划行动、与外部工具(如 web search, code execution)交互并利用反馈进行调整。
  • Workflow 模式包括 prompt chaining(子任务序列化)、routing(简单路径 vs. 复杂路径)、parallelization(在不同输入上同时进行 LLM 调用)以及 orchestrator‑worker(由一个规划器 LLM 分派给 worker LLM)。
  • Verifiers(单元测试、基于规则的检查器)和 critics (LLM‑as‑judge) 为自我纠正和回溯提供反馈。
  • 讨论的示例:用于编程辅助的 Claude Code 以及用于端到端文献综述的 deep‑research 工具,两者都依赖于上述模式。
  • 有效的 Agent 能够进行强大的规划、多步推理,并根据工具输出或 verifier 信号进行修订步骤。

Course Logistics

课程结构、评估方式和预期要求如下所示。

  • Prerequisites: 熟悉机器学习基础知识和深度学习(如课程网站上列出的内容)。

  • Materials: 讲座 slides, readings, 和 videos 均发布在 Canvas 和公开网站 cs329a.stanford.edu 上。

  • Assessment: 三次作业 (50% 成绩) 和一个课程项目 (50% 成绩)。

  • Homework schedule 和 due dates 均可在 Canvas 上查看;根据发布的政策,允许使用 late days。

  • Project 可以单独进行或以最多四人的团队进行;提供 API credits。

  • Milestones: 项目提案 (early October), 中期展示 (提案提交后两周), 最终报告和海报展示 (December 12, 4‑6 PM)。

  • Projects 应该具有研究导向性 (hypothesis‑driven, 而不仅仅是一个 app);过去的项目已成功转化为会议论文发表。

  • Office hours 和 Q&A 均通过 Ed (公开论坛) 和 Gradescope 进行提交。

  • Lecture 视频将最终发布在 YouTube 待查阅模式 (audit‑only viewing, 且不计入学分)。

Sources