斯坦福 CS229 机器学习 2026年春季 第一讲 介绍

课程概述与理念

斯坦福 CS229 是一门数学密集型的课程,侧重于机器学习的基础而非编程。课程强调数学建模、公式和推导,以确保学生理解算法和代码的底层机制。

先决条件与支持

成功完成该课程需要具备概率和线性代数的背景。对于缺少特定基础知识的学生,课程通过小节和周五助教讲座提供支持,帮助他们补上基础。

AI 工具政策

AI工具被允许作为"人类或超人类协作者",但有严格限制:学生不得将AI工具的结果直接复制到他们的提交中。此政策旨在确保学生"训练"自己的大脑和突触,而不仅仅是构建一个代理来理解材料。

定义机器学习

尽管该领域发展迅速,机器学习的传统定义仍然基本准确。课程引用了两个关键的历史定义:

  • 1959 定义: 机器学习是一门研究领域,它赋予计算机在没有被显式编程的情况下学习的能力。
  • 1998 (Tom Mitchell) 定义: 如果一个计算机程序在任务类别 T 上的性能 P 随着经验 E 的增加而提升,则可以说该程序基于经验 E 相对于任务类别 T 和性能度量 P 进行学习。

组成部分的现代解释

  • Experience (E): 现在涵盖更广泛的数据范围,包括合成数据、思考令牌、网络数据和人工标注数据。
  • Tasks (T): 尽管任务曾经是特定的(例如,图像分类或价格预测),但现代模型是通用的,能够同时解决数百万个任务。
  • Performance Measure (P): 这仍然是驱动学习过程的目标(例如,准确率)。学习被定义为在经验 E 增加时 P 的提升。

机器学习技术的分类学

尽管该领域发展太快,难以就分类学达成普遍共识,但课程将机器学习组织为三种主要范式,这些范式常被用作构建通用代理的工具。

监督学习

监督学习涉及使用标注数据从输入 (X) 预测输出 (Y)。

  • 回归: 当输出是连续变量时(例如,基于面积预测房价)。
  • 分类: 当输出是离散变量或标签时(例如,识别图像中是否含有火烈鸟或猫)。

大型语言模型(LLMs)本质上是分类问题,因为预测下一个标记涉及从50,000到250,000个选项的词汇表中选择一个离散标签。

无监督学习

无监督学习旨在寻找输入数据中但没有对应标签的有趣结构或模式。

  • 聚类: 将相似的数据点分组在一起(例如,将基因表达分组以识别疾病或按主题聚类文档)。
  • 嵌入: 将单词或概念表示为高维向量,其中距离和方向对应语义关系(例如,首都城市及其国家之间的向量关系)。
  • 生成模型: 使用未标注的数据创建新的逼真内容,例如用于图像生成的扩散模型。

强化学习 (RL)

强化学习关注序列决策过程,其中动作会影响未来状态。

  • 传统 RL: 用于机器人(学习行走)或游戏(AlphaGo),其中代理通过试错学习。
  • 面向 LLMs 的现代 RL: 用于处理文本生成过程中的随机采样。由于采样不是可微操作,RL 技术如策略梯度用于基于奖励(人类反馈或奖励模型)更新模型。
  • 自举: RL 允许交互式数据收集。例如,在自动定理证明中,模型生成证明,正确的证明被验证并重新加入训练集,形成自我改进的循环。

其他课程主题

除了核心范式外,课程将涵盖:

  • 深度学习: 使用具有数百万或数十亿参数的神经网络来模拟类似大脑的突触,通过损失函数和反向传播进行训练。
  • ML 系统: 软件与硬件的交叉领域,以优化效率。即使算法速度提高 20% 也能带来巨大的成本节省和前沿实验室更快的开发周期。
  • 社会影响: 计划探讨公平性以及 AI 的社会后果,包括其对就业市场的影响。

Sources