word2vec 学到的内容:特征学习的闭式理论

BAIR 研究人员提供了一套定量且可预测的理论,解释了 word2vec 的学习过程,证明在特定的实际情境下,学习问题可以简化为无权重的最小二乘矩阵分解。研究表明,最终学习得到的表示是对由语料库统计得到的目标矩阵进行主成分分析(PCA)的结果。

word2vec 作为最小语言模型

word2vec 作为一种基础算法,通过对比学习来获取词语的密集向量表示。得到的嵌入通过向量之间的角度捕捉语义关系,常表现出线性结构,其中子空间编码可解释的概念,如性别、动词时态或方言。该“线性表示假设”是模型能够完成类比(例如 “man : woman :: king : queen”)的关键因素,这一行为在现代大型语言模型(LLMs)中也有观察到。

由于 word2vec 本质上是一个两层线性网络,通过自监督的梯度下降来建模统计规律,它充当了最小的神经语言模型。理解其特征学习被视为掌握更复杂语言建模任务的前提。

离散学习步骤的理论

研究证明,当嵌入向量随机初始化且非常接近原点时,模型会在一系列离散步骤中一次学习一个“概念”(正交线性子空间)。

秩递增动力学

每一个新实现的线性概念都会提升嵌入矩阵的秩。该过程使词嵌入能够扩展到维度不断增加的子空间,提供更大的空间来更好地表达意义。由于这些线性子空间在学习后不再旋转,它们即成为模型的学习特征。

闭式特征计算

这些特征可以事先以闭式形式计算,即目标矩阵 $M^*$ 的特征向量,定义如下:

$$M^*_{i,j} = \frac{P(i,j) - P(i)P(j)}{\sqrt{2\bigl(P(i,j) + P(i)P(j)\bigr)}}$$

其中:

  • $i$ 和 $j$ 为词汇表中的词索引。
  • $P(i,j)$ 为词 $i$ 与词 $j$ 的共现概率。
  • $P(i)$ 为词 $i$ 的单词概率(unigram)。

将其应用于 Wikipedia 统计数据可见,前几大特征向量对应可解释的主题层面概念,如名人传记、政府行政以及地理描述等。

理论近似与实证验证

为了得到这些闭式解,研究人员采用了四个温和的近似:

  1. 对目标函数在原点附近进行四次近似。
  2. 对算法超参数施加特定约束。
  3. 初始嵌入权重足够小。
  4. 梯度下降步长趋近于零。

关键是,这些近似不涉及数据分布,使得理论对分布保持中立。

性能比较

该理论的有效性通过标准类比完成基准的实证结果得到支持:

  • Original word2vec:68% 准确率
  • Approximate model (studied in theory):66% 准确率
  • Standard classical alternative (PPMI):51% 准确率

对抽象表示的启示

该理论被用于分析抽象线性表示的出现(例如男性/女性等二元概念)。研究人员发现,word2vec 在一系列带噪声的学习步骤中构建这些表示,其几何结构可由尖峰随机矩阵模型描述。虽然语义信号在训练早期占主导,但噪声在训练后期可能占据主导,进而削弱模型解析这些线性表示的能力。

Sources