BERT 101: トランスフォーマーからの双方向エンコーダ表現の理解

BERT(Bidirectional Encoder Representations from Transformers)は、自然言語処理(NLP)向けの機械学習モデルで、11 以上の一般的な言語タスクに対する汎用的なソリューションを提供します。2018 年に Google AI Language によって開発され、単一のモデルで幅広いアプリケーションにおいて従来のタスク固有モデルを上回る性能を実現し、分野に革命をもたらしました。

コア機能とユースケース

BERT は感情分析から高度な読解まで、さまざまな NLP タスクに対応できるよう設計されています。主な活用例は次のとおりです。

  • 感情分析: 映画レビューなどのテキストの極性(肯定か否定か)を判定します。
  • 質問応答: チャットボットに正確なユーザー質問への回答を提供させます。
  • テキスト予測・生成: メール(例: Gmail)で次の文を予測したり、短い入力から記事を生成したりします。
  • 要約: 法的契約書などの長文ドキュメントを短い要約に圧縮します。
  • 多義語解消: 文脈に基づき「bank」など複数の意味を持つ語を正しく区別します。

2020 年 11 月以降、BERT は Google 検索に統合され、英語クエリの理解を向上させています。たとえば、処方箋に関する検索で「for someone」というフレーズが、別の人の薬を受け取ることを意味することを検索エンジンが認識できるようになりました。

技術アーキテクチャと学習

BERT の性能は、Transformer アーキテクチャの活用と、2 段階の学習プロセス(大量のラベルなしデータでの自己教師あり事前学習、続いて少量の人手アノテーションデータでのファインチューニング)によって支えられています。

学習データとインフラストラクチャ

BERT は 33 億語のデータセット(Wikipedia 約 25 億語、Google の BooksCorpus 約 8 億語)で学習されました。この膨大なデータ量を処理するために、Google は Tensor Processing Units(TPU)を使用しました。BERT‑base は 4 台の TPU で 4 日間、BERT‑large は 16 台の TPU で同じく 4 日間学習されました。

Masked Language Model(MLM)

BERT は Masked Language Model(MLM)を用いて双方向学習を実現します。学習時にランダムに 15% のトークンがマスクされ、モデルはマスクの左側と右側の両方の文脈を利用してこれらの単語を予測しなければなりません。これは従来の線形にテキストを読むモデルとは異なります。

Next Sentence Prediction(NSP)

文間関係を理解するために、BERT は Next Sentence Prediction(NSP)を使用します。モデルは正しい文ペア(2 文目が 1 文目に続く)とランダムな文ペアを 50/50 の比率で学習し、ある文が論理的に前の文に続くかどうかを予測します。

Transformer エンコーダ

BERT は Transformer アーキテクチャのエンコーダ部分を利用し、注意機構で単語に差別的な重み付けを行い、重要な情報に焦点を当て、無関係なデータは無視します。他の一部の Transformer モデルとは異なり、BERT はデコーダを使用しません。

モデルバリエーションと仕様

BERT は性能と計算コストのバランスを取るために、さまざまなサイズで提供されています。

Model Transformer Layers Hidden Size Attention Heads Parameters Processing Training Length
BERTbase 12 768 12 110M 4 TPUs 4 days
BERTlarge 24 1024 16 340M 16 TPUs 4 days

モバイル端末など計算資源が限られた環境向けに、2020 年 3 月に 23 種類の小型 BERT モデルがリリースされました。さらに、DistilBERT は 60% 高速で動作しながら BERT の性能の 95% 以上を維持する軽量版です。

パフォーマンスベンチマーク

BERT は 11 の一般的な NLP タスクで最先端の精度を達成し、いくつかのベンチマークでは人間レベルの性能を初めて上回りました。

  • SQuAD(Stanford Question Answering Dataset): 108k の質問からなる読解データセット。BERT は従来の最先端モデルと人間の両方を上回る性能を示しました。
  • SWAG(Situations With Adversarial Generations): 113k の選択式問題からなる常識推論データセット。BERT はここでも人間レベルを超えました。
  • GLUE(General Language Understanding Evaluation): 9 つの難易度の高いタスクからなるベンチマークで、言語モデルを比較・評価します。

オープンソースへの影響と倫理的考慮事項

BERT のソースコードは GitHub で公開されており、開発者は大規模な事前学習コストを負担せずに特定用途向けにファインチューニングできます。この民主化により、Twitter の感情分析、臨床ノート解析、毒性コメント検出など、数千の専門的オープンソースモデルが誕生しました。

環境への影響

大規模モデルの学習は計算コストが高く、炭素フットプリントも大きいです。事前学習済みモデルのオープンソース共有は、AI コミュニティ全体の計算コストと環境負荷を削減する主要手段として提示されています。

モデルバイアス

BERT は学習データに含まれるバイアスをそのまま反映します。例として、プロンプト "The man worked as a [MASK]" に対しては大工や整備士といった職業を、"The woman worked as a [MASK]" に対しては看護師、ウェイトレス、メイドなどを提示し、職業における明確な性別バイアスが見られます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch