斯坦福 CS229 机器学习 2026年春季 第一讲 介绍
课程概述与理念
斯坦福 CS229 是一门数学密集型的课程,侧重于机器学习的基础而非编程。课程强调数学建模、公式和推导,以确保学生理解算法和代码的底层机制。
先决条件与支持
成功完成该课程需要具备概率和线性代数的背景。对于缺少特定基础知识的学生,课程通过小节和周五助教讲座提供支持,帮助他们补上基础。
AI 工具政策
AI工具被允许作为"人类或超人类协作者",但有严格限制:学生不得将AI工具的结果直接复制到他们的提交中。此政策旨在确保学生"训练"自己的大脑和突触,而不仅仅是构建一个代理来理解材料。
定义机器学习
尽管该领域发展迅速,机器学习的传统定义仍然基本准确。课程引用了两个关键的历史定义:
- 1959 定义: 机器学习是一门研究领域,它赋予计算机在没有被显式编程的情况下学习的能力。
- 1998 (Tom Mitchell) 定义: 如果一个计算机程序在任务类别 T 上的性能 P 随着经验 E 的增加而提升,则可以说该程序基于经验 E 相对于任务类别 T 和性能度量 P 进行学习。
组成部分的现代解释
- Experience (E): 现在涵盖更广泛的数据范围,包括合成数据、思考令牌、网络数据和人工标注数据。
- Tasks (T): 尽管任务曾经是特定的(例如,图像分类或价格预测),但现代模型是通用的,能够同时解决数百万个任务。
- Performance Measure (P): 这仍然是驱动学习过程的目标(例如,准确率)。学习被定义为在经验 E 增加时 P 的提升。
机器学习技术的分类学
尽管该领域发展太快,难以就分类学达成普遍共识,但课程将机器学习组织为三种主要范式,这些范式常被用作构建通用代理的工具。
监督学习
监督学习涉及使用标注数据从输入 (X) 预测输出 (Y)。
- 回归: 当输出是连续变量时(例如,基于面积预测房价)。
- 分类: 当输出是离散变量或标签时(例如,识别图像中是否含有火烈鸟或猫)。
大型语言模型(LLMs)本质上是分类问题,因为预测下一个标记涉及从50,000到250,000个选项的词汇表中选择一个离散标签。
无监督学习
无监督学习旨在寻找输入数据中但没有对应标签的有趣结构或模式。
- 聚类: 将相似的数据点分组在一起(例如,将基因表达分组以识别疾病或按主题聚类文档)。
- 嵌入: 将单词或概念表示为高维向量,其中距离和方向对应语义关系(例如,首都城市及其国家之间的向量关系)。
- 生成模型: 使用未标注的数据创建新的逼真内容,例如用于图像生成的扩散模型。
强化学习 (RL)
强化学习关注序列决策过程,其中动作会影响未来状态。
- 传统 RL: 用于机器人(学习行走)或游戏(AlphaGo),其中代理通过试错学习。
- 面向 LLMs 的现代 RL: 用于处理文本生成过程中的随机采样。由于采样不是可微操作,RL 技术如策略梯度用于基于奖励(人类反馈或奖励模型)更新模型。
- 自举: RL 允许交互式数据收集。例如,在自动定理证明中,模型生成证明,正确的证明被验证并重新加入训练集,形成自我改进的循环。
其他课程主题
除了核心范式外,课程将涵盖:
- 深度学习: 使用具有数百万或数十亿参数的神经网络来模拟类似大脑的突触,通过损失函数和反向传播进行训练。
- ML 系统: 软件与硬件的交叉领域,以优化效率。即使算法速度提高 20% 也能带来巨大的成本节省和前沿实验室更快的开发周期。
- 社会影响: 计划探讨公平性以及 AI 的社会后果,包括其对就业市场的影响。