Stanford CS229 2026年春季 第14講:Transformer 與 上下文學習

TL;DR

講解大型語言模型如何將文本轉換為詞元,使用 Transformer 自回歸地建模詞元序列,透過最大似然進行訓練,並使用如溫度縮放和 top‑k 抽樣等技巧生成文本,同時指出自注意力隨序列長度呈二次增長。

Tokenization

詞元化將原始文本轉換為 Transformer 可處理的整數 ID 序列。講者將詞元化描述為選擇最小的輸入單位,並指出純字元或詞彙詞元化效率低下。子詞詞元化(例如位元對編碼)將單詞拆分為可重複使用的片段,使模型能夠在如「internationalize」和「internationalization)」等相關單詞之間共享理解。得到的詞彙表是預定義的子詞列表;每個詞元都會獲得一個 ID。講者提到,開源模型如 Qin 3.5 的詞彙表大約有 250 個詞元(根據講者的說法),而某些專有詞元化器(如 Cloud Code 所使用的)已被做得更細緻,使相同文本的詞元數從約 1,000 增加到 1,500 個。

Autoregressive Probability Model

語言模型使用鏈規則定義詞元序列上的機率分布:p(x₁…x_T) = ∏ₜ p(x_t | x₁…x_{t‑1})。每個條件分布由神經網路建模,該網路輸出詞彙表上的 logit 向量,再經 softmax 轉換為機率。由於直接建模聯合分布需要 V^T} 次方的計算量,難以處理,自回歸分解將每一步減少為對 V‑的 softmax,因而變得可管理。

Transformer Architecture

Transformer 計算的詞元序列 t 僅依賴於前面的詞元,模型因而具備因果性(自回歸)。在訓練期間,損失為觀測序列的負對數似然,計算方式為 −log softmax(f_θ(x₀…x_{t‑1}))[x_t] 的總和。在生成時,模型從這些條件分布中逐個詞元進行抽樣;溫度縮放會使分布變尖銳或變平緩,而 top‑k 抽樣則限制考慮範圍僅為 k 個最可能的詞元。

Attention Mechanism

單頭注意力層接受一個向量序列(詞元嵌入)並輸出一個新的向量序列。對於每個位置 t,它計算查詢 Q_t = h_t W_Q、鍵 K_t = h_t W_K、以及值 V_t = h_t W_V(全部為行向量)。注意力分數為所有來源位置 s 的內積 Q_t·K_sᵀ,經縮放後通過 softmax 得到權重 α_{t,s}。位置 t 的輸出為加權和 ∑s α{t,s} V_s。為強制因果性,會在 softmax 之前將未來位置的分數設為 −∞,以確保當 s>t 時 α_{t,s}=0。

Multi‑Head Attention and Masking

多個注意力頭平行運行,每個頭具有自己的投影矩陣(W_Q、W_K、W_V)。它們的輸出會被串聯並經線性投影以產生最終層輸出。講者指出,注意力頭的數量通常隨模型規模而在十到百量級。遮罩會在每個頭內部應用,以保持自回歸特性:在 softmax 之前,任何對應未來詞元的分數會被替換為 −∞,經 softmax 後變為零,從而防止模型關注未來詞元。

MLP and Residual Connections

在每個注意力層之後,每個位置的向量會通過一個多層感知器(MLP),該 MLP 由兩個線性層和一個非線性函數(例如 GeLU)組成。MLP 在每個位置上獨立且相同地應用。殘差連接將該層的輸入加到其輸出上,然後進行層規範化(講者提到有 pre‑norm 或 post‑norm 變體)。此模式——注意力 → 加 & 規範 → MLP → 加 & 規範——會在多個 Transformer 層中重複。

Training and Generation

訓練透過最小化所有時間步的負對數似然總和來進行,使用如 SGD 或 Adam 之類的優化器(被稱為黑箱優化器)。生成從句首詞元(或給定的提示)開始,並迭代地從 softmax 分布中抽樣下一個詞元。溫度 t 會在 softmax 之前對 logit 進行縮放:t<1 會使分布變尖銳(偏好高機率詞元),t>1 會使分布變平緩(增加多樣性)。top‑k 抽樣僅保留 k 個最大的 logit,重新歸一化後從該子集中進行抽樣。

Computational Efficiency

講者強調,天真的自注意力需要計算所有成對內積,導致時間和記憶體複雜度為 O(T²·d_h),其中 T 為序列長度,d_h 為頭維度。這種二次依賴在長上下文(例如數百萬個詞元)時會變得難以如期處理。如 flash attention 等技術旨在通過即時重新計算注意力矩陣的部分來降低記憶體佔用。講者指出,替代的注意力變體可以改善對 T 的依賴,但可能會犧牲表達力。


僅基於提供的逐字稿;未添加任何外部事實。

Sources