word2vec學習了什麼:特徵學習的閉式理論

BAIR研究人員提供了一個量化且可預測的理論,說明word2vec的學習過程,證明在特定的實務情境下,學習問題可簡化為無權重最小二乘矩陣分解。研究顯示,最終學得的表示是由根據語料統計衍生的目標矩陣進行主成分分析(PCA)得到的。

word2vec作為最小語言模型

word2vec作為一個基礎演算法,透過對比學習來獲得詞語的密集向量表示。得到的嵌入透過向量之間的角度捕捉語義關係,常呈現線性結構,子空間編碼可解釋的概念,如性別、動詞時態或方言。這個「線性表示假說」是模型能完成類比(例如「man : woman :: king : queen」)的關鍵因素,也在現代大型語言模型(LLMs)中觀察到類似行為。

由於word2vec本質上是一個兩層線性網路,透過自監督的梯度下降訓練以建模統計規律,它充當了最小的神經語言模型。了解其特徵學習被視為掌握更複雜語言建模任務的前提。

離散學習步驟的理論

研究證明,當嵌入向量以隨機且極接近原點的方式初始化時,模型會以離散步驟的序列一次學習一個「概念」(正交線性子空間)。

階數遞增動力學

每個新實現的線性概念都會提升嵌入矩陣的階數。此過程使詞向量得以擴展到更高維度的子空間,提供更多空間以更好地表達意義。由於這些線性子空間在學習後不再旋轉,它們即成為模型所學到的特徵。

閉式特徵計算

這些特徵可以事先以閉式形式計算,作為目標矩陣 $M^*$ 的特徵向量,其定義為:

$$M^*{i,j} = \frac{P(i,j) - P(i)P(j)}{\sqrt{2(P(i,j) + P(i)P(j))}}$$

  • $i$ 和 $j$ 為詞彙表中詞語的索引。
  • $P(i,j)$ 為詞語 $i$ 與 $j$ 的共現機率。
  • $P(i)$ 為詞語 $i$ 的單字頻率機率。

將此套用於 Wikipedia 統計資料,可見前幾個特徵向量對應到可解釋的主題層級概念,例如名人傳記、政府行政與地理描述等。

理論近似與實證驗證

為了得到這些閉式解,研究人員採用了四項溫和的近似:

  1. 在原點附近對目標函數進行四次近似。
  2. 對演算法超參數施加特定限制。
  3. 初始嵌入權重足夠小。
  4. 梯度下降步長趨近於零。

關鍵是,這些近似並未涉及資料分布,使得理論對分布保持無關性。

效能比較

該理論的有效性得到標準類比完成基準的實驗結果支持:

  • Original word2vec: 68% 正確率
  • Approximate model (studied in theory): 66% 正確率
  • Standard classical alternative (PPMI): 51% 正確率

抽象表示的意涵

該理論被用來分析抽象線性表示的形成(例如男性/女性等二元概念)。研究人員發現word2vec在一系列帶噪聲的學習步驟中構建這些表示,其幾何結構可由尖峰隨機矩陣模型描述。雖然語義訊號在訓練初期占主導,但噪聲在訓練後期可能占優,進而削弱模型解析這些線性表示的能力。

Sources