Stanford CS229 機器學習 2026年春季 第2講:監督學習設置
監督學習設置
監督學習從標記的訓練對中學習假設,以預測新輸入的輸出。假設是一個將輸入空間 X 映射到輸出空間 Y 的函數 h。訓練集由配對 (x^{(i)}, y^{(i)}) 構成,其中 x^{(i)} ∈ X 為輸入範例,y^{(i)} ∈ Y 為其標籤。目標是選擇 h,使其在未見輸入上的預測與真實輸出接近,這個性質稱為泛化。
迴歸 vs 分類
當輸出空間 Y 包含實數時,問題為迴歸;當 Y 包含有限集合的離散標籤時,問題為分類。迴歸的例子包括預測房價;分類的例子包括偵測圖像是否包含貓或狗。講義指出 chat‑GPT 使用分類器頭來猜測下一個詞,說明在更大系統內的一個分類組件。
線性假設與最小平方
線性(仿射)假設的形式為 h_θ(x) = θ^T x,其中 θ 為參數向量,且約定 x_0 = 1 吸收截距項。參數是通過最小化以平方誤差衡量的經驗風險來選擇的。損失函數為 J(θ) = ½ Σ_{i=1}^n (h_θ(x^{(i)}) - y^{(i)})^2。將 J 對 θ 的梯度設為零可得到正規方程,當設計矩陣滿足某些條件時,這給出封閉形式的解。
梯度下降基礎
梯度下降通過沿著梯度相反方向迭代更新 θ 來尋找使 J 最小的參數向量:θ ← θ - α ∇J(θ)。步長 α 控制每次更新移動的距離。如果 α 過大,更新可能會越過最小值並導致振盪;如果 α 過小,收敛會很慢。講義指出選擇 α 是一個實務問題,且自適應優化器(例如 Adam、Adagrad)可以自動調整它。
隨機梯度下降與小批次
隨機梯度下降(SGD)使用隨機選取的小批次訓練樣本上的估計來替代完整批次梯度。這將每次迭代的成本從 O(n) 減少到 O(batch size),並使在非常大的資料集上進行訓練成為可能。小批次是均匀隨機抽取的;有放回或無放回抽樣在實務上表現相似,且無放回通常更易實現。批次必須代表整體資料;否則模型可能會對抽樣子集過度擬合(例如,只看到貓然後只看到狗)。批次大小涉及權衡:較小的批次會產生噪聲較大的梯度但更新頻率更高;較大的批次則梯度變異較小,但需要更多記憶體和計算。系統考量(如 GPU 記憶體)在實務上常決定所選的批次大小。
正規方程與線性代數
當設計矩陣 X(其行為 x^{(i)T})具有滿列秩時,X^T X 可逆,且最小平方解為 θ* = (X^T X)^{-1} X^T y。此解為精確解,無需迭代。推導假設樣本數 n 至少等於特徵數 d(加上截距)。X^T X 是半正定的;可逆性要求它必須是正定的。若 X^T X 為奇異矩陣,則解不唯一;null space 中的任何向量可加到 θ* 上而不改變損失。
實務建議
學生在建模前應該檢視自己的資料,因為視覺檢查可以揭示模式和資料品質問題。講義鼓勵在實時課程中提問,並利用星期五的 TA 小節來複習符號、微積分和線性代數。提供的投影片和課堂筆記是推薦的資源;共同講師的筆記被描述為最完整的嚴格學習參考。