word2vecが学習すること: 特徴学習の閉形式理論
BAIR の研究者は、word2vec の学習過程を定量的かつ予測的に説明する理論を提示し、特定の実用的な条件下で学習問題が重みなし最小二乗行列因子分解に帰着することを証明しました。この研究は、最終的に得られる表現がコーパス統計から導かれるターゲット行列の主成分分析(PCA)によって与えられることを明らかにしています。
Word2vecを最小限の言語モデルとして
word2vec は、対照的なアルゴリズムを通じて単語の密なベクトル表現を学習する基礎的な手法です。得られた埋め込みはベクトル間の角度を通じて意味的関係を捉え、しばしばサブスペースが性別、動詞の時制、方言といった解釈可能な概念を符号化する線形構造を示します。この「線形表現仮説」は、モデルが類推(例: "man : woman :: king : queen")を完遂できる主要な要因であり、現代の大規模言語モデル(LLM)でも観測される振る舞いです。
word2vec は本質的に自己教師あり勾配降下で統計的規則性をモデル化する二層線形ネットワークであるため、最小限のニューラル言語モデルとして機能します。その特徴学習を理解することは、より複雑な言語モデリング課題を理解するための前提条件と考えられています。
離散的学習ステップの理論
研究は、埋め込みベクトルがランダムに、かつ原点に極めて近い状態で初期化されると、モデルが「概念」(直交する線形サブスペース)を一度に一つずつ、離散的なステップで学習することを証明しています。
ランク増加ダイナミクス
各新たに実現された線形概念は埋め込み行列のランクを1つ増加させます。このプロセスにより、単語埋め込みは次第に次元が拡大したサブスペースへと広がり、意味をより豊かに表現できる余地が増えます。これらの線形サブスペースは一度学習されると回転しないため、モデルが獲得した特徴として機能します。
閉形式の特徴計算
これらの特徴は、以下のように定義されたターゲット行列 $M^*$ の固有ベクトルとして、事前に閉形式で計算できます。
$$M^*_{i,j} = \frac{P(i,j) - P(i)P(j)}{\sqrt{2\bigl(P(i,j) + P(i)P(j)\bigr)}}$$
ここで
- $i$ と $j$ は語彙中の単語インデックス、
- $P(i,j)$ は単語 $i$ と $j$ の共起確率、
- $P(i)$ は単語 $i$ のユニグラム確率です。
この式を Wikipedia の統計に適用すると、上位の固有ベクトルが有名人の伝記、政府の行政、地理的記述といった解釈可能なトピックレベルの概念に対応することが示されます。
理論的近似と実証的検証
閉形式解を得るために、研究者は以下の4つの緩やかな近似を導入しました。
- 原点付近での目的関数の四次近似。
- アルゴリズムのハイパーパラメータに対する特定の制約。
- 十分に小さな初期埋め込み重み。
- 極めて小さな勾配降下ステップ。
重要なのは、これらの近似がデータ分布に依存しない点であり、理論は分布に対して無依存(distribution‑agnostic)です。
性能比較
理論の妥当性は、標準的な類推完成ベンチマークにおける実験結果で裏付けられています。
- Original
word2vec: 68% の正解率 - Approximate model (studied in theory): 66% の正解率
- Standard classical alternative (PPMI): 51% の正解率
抽象的表現への示唆
この理論は、抽象的な線形表現(例: 男性/女性といった二元概念)の出現を分析するために用いられました。研究者は、word2vec がこれらの表現をノイズの多い学習ステップの連続として構築し、幾何学的にはスパイク付きランダム行列モデルで記述できることを発見しました。訓練初期では意味的シグナルが支配的ですが、訓練が進むにつれてノイズが支配的になる可能性があり、これが線形表現の解像度を低下させる要因となり得ます。