トランスフォーマーの謎を解く:最新LLMの数学を徹底解説

Large Language Model(LLM)の内部動作はしばしば「ブラックボックス」のように感じられます。高度な抽象化や複雑な行列演算に隠れているからです。開発者や研究者にとって、トークンIDから確率分布への正確なデータフローを理解することは、性能最適化や、マルチヘッド潜在注意(MLA)や専門家混合(MoE)といったアーキテクチャ上のイノベーションが実際にどのように機能するかを把握する上で不可欠です。

Transformer Math Explorer は、これらのプロセスを稀に見るほど詳細に示します。高レベルの行列積を意図的に排除し、明示的な和とインデックスで記述することで、現代の AI が生成するすべてのトークンを支える基本的な数学を明らかにします。

高レベルのフロー:トークンから確率へ

本質的に、Transformer モデル(例:GPT‑2)はトークンID を入力、次トークンの確率を出力とする関数とみなすことができます。このプロセスは以下の構造化パイプラインに従います。

  1. 埋め込み(Embeddings):トークンID が連続ベクトルに変換されます。
  2. Transformer ブロック:これらの埋め込みが $L$ 個の同一ブロックを通過し、文脈中のトークン表現が洗練されます。
  3. 出力ヘッド(Output Head):最終的に処理されたベクトルが語彙サイズにマッピングされ、次トークンの確率分布が生成されます。

Transformer ブロックの構造

各 Transformer ブロックは、信号の安定性を保ちつつ、モデルが複雑なパターンを学習する能力を高めるよう設計されています。標準的なブロックは主に二つのサブレイヤーから構成されます。

  • 因果的自己注意(Causal Self-Attention):シーケンス内の異なるトークンの重要度を評価します。
  • 多層パーセプトロン(MLP):注意機構で抽出された情報を処理します。

両サブレイヤーは 残差接続(residual connections) で包まれており、学習時の勾配消失問題を防ぎます。また、正規化(normalization) レイヤーが併せて配置され、活性化が安定した範囲に収まるようにします。

因果的自己注意のメカニズム

自己注意は Transformer のエンジンです。単一ヘッドの場合、計算は次のような厳密な手順で行われます:入力 $x$ をクエリ($Q$)、キー($K$)、バリュー($V$)ベクトルへ射影し、互いの適合度をスコア付けし、因果性を保つために将来位置をマスクし、softmax を適用し、最後にバリューの重み付き和を算出します。

スケールド・ドット積

位置 $t$ のクエリと位置 $s$ のキー間の「適合度スコア」は、スケールド・ドット積を用いて計算されます。ヘッド幅 $d_h$ が大きくなるとスコアの分散が爆発するのを防ぐため、結果は $\sqrt{d_h}$ で割られます。

$$z_{t , s} = \frac{1}{\sqrt{d_{h}}} \sum_{0 \leq a < d_{h}} q_{t , a} k_{s , a}$$

KV キャッシュ

自己回帰生成では、モデルは一度に 1 トークンずつ出力します。注意機構は因果的であるため、位置 $t$ のキー($k_t$)とバリュー($v_t$)ベクトルは位置 $\leq t$ の入力にのみ依存します。

したがって、これらのベクトルは後続トークンがシーケンスに追加されても変化しません。冗長な計算を避けるため、モデルは KV キャッシュ を使用し、これらのベクトルを保存して各デコードステップで再利用します。これにより、長いシーケンス生成時の計算コストが大幅に削減されます。

基礎を超えて:最新アーキテクチャのバリエーション

基本的な数学は変わりませんが、近年のモデルは効率性と推論能力を高めるためにさまざまな最適化を導入しています。Transformer Math Explorer では、以下の高度な構成を切り替えて体験できます。

  • MLA(Multi-Head Latent Attention):KV キャッシュのメモリフットプリントを削減する最適化。
  • MoE(Mixture of Experts):密な MLP 層を疎な「エキスパート」ネットワークに置き換え、計算コストを比例的に増やさずにモデル容量を拡大します。
  • RoPE(Rotary Positional Embeddings):ベクトルを複素空間で回転させて位置情報をエンコードする高度な手法で、長文コンテキストへの対応力が向上します。
  • MTP(Multi-Token Prediction):モデルが単一トークンではなく複数の将来トークンを同時に予測するアーキテクチャ的シフト。

これらの概念を基本的な和とインデックスに分解することで、「線形代数」という抽象を超え、機械が文中の次の単語を予測できる実際の算術を目にすることができます。

Sources