為什麼「下一標記預測器」的心智模型對現代 LLM 而言是不完整的
下一標記預測器模型的局限性
雖然大型語言模型 (LLMs) 在推理時作為下一標記預測器運作——逐一發出標記——但這種描述對於現代模型如何訓練以及它們編碼了什麼來說,是一個不完整的心智模型。「下一標記預測器」這個標籤準確地描述了輸出的 機制(推理迴圈的形狀),但它未能捕捉到後訓練模型的 目標。
預訓練 vs. 後訓練目標
基礎模型如何學習與後訓練模型如何透過強化學習演進之間存在根本區別。
預訓練:模仿與預測
在預訓練期間,模型充當傳統的下一標記預測器。它分析訓練數據集中的現有序列,並調整其參數,使該序列中實際的下一個標記更有可能被採樣。其目標純粹是預測性的:模型學習模仿其訓練數據的統計模式。
後訓練:透過 RLVR 最大化獎勵
現代 LLMs 會經歷後訓練,特別是具有可驗證獎勵的強化學習 (RLVR)。在 RLVR 中,模型沒有一個來自數據集的「正確」下一個標記可供預測。相反,它透過生成新序列來進行探索,並根據結果獲得獎勵。
在這種範式下,模型使某個標記的可能性增加,並非因為它出現在訓練集中,而是因為包含該標記的序列導致了高獎勵。目標從 預測數據中的下一個標記 轉向了 最大化獎勵函數。
象棋比喻:預測 vs. 優化
為了說明模仿與優化的區別,請考慮兩種類型的象棋系統:
- 下一招預測器: 一個在特大師賽局數據庫上訓練的系統。它預測特大師在給定位置時最有可能下的那一招。它僅限於模仿現有的人類棋局。
- 獎勵最大化器: 一個理想化的引擎,它探索所有可能的棋局以確定從任何位置獲勝的機率。它選擇能使勝率最大化的那一招,無論人類是否曾下過那一招。
將第二種系統稱為「下一招預測器」是有誤導性的,因為其目標不是預測數據集,而是贏得比賽。
社群觀點的綜合
技術從業者之間的討論揭示了對於「下一標記預測器」標籤是否從根本上錯誤,或者僅僅是抽象層級的問題,存在著深刻的分歧。
支持該模型有效性的論點
有些人認為,無論訓練目標是什麼 (RLVR 或預訓練),數學運算仍然相同:計算條件機率 $P(\text{token}k | \text{tokens}{1...k-1})$。
"The mechanism used to do that doesn't matter, it's still predicting the next token whether that's because it maximises a reward or because it follows a gradient or whatever else one might think."
其他人建議,「下一標記預測器」模型對於解釋常見的 LLM 失敗模式很有用,例如在回應的早期「鎖定」在錯誤答案上,因為模型無法自我編輯先前發出的標記。
反對該模型有效性的論點
該標籤的批評者認為,它經常被用作一種「還原論」工具,用以否定 LLM 的湧現能力。他們主張,僅僅關注標記逐一生成的機制,忽略了必須形成複雜的內部表示和「世界模型」才能使這些預測準確。n
"It's like saying a Boeing 777 is just a rotating machine, and it flies by just rotating some fins. Well yes, but no. With that level of simplification we've just ignored 150 tons of advanced engineering and physics."
湧現與代理系統
有些人建議,「下一標記預測器」是基礎組件,但產生的系統是更進一步的東西。在這種觀之下,現代 AI 是一個湧現系統,其中簡單的規則(標記預測)與複雜的交互作用(RLVR、工具使用、遞迴調用)共同創造了超越簡單預測器標籤的能力。
Sources
相關
- Dispatch
- 專案
- 專案
- Dispatch
- Dispatch