OpenAIの教師なし学習による言語理解の向上
OpenAIは、単一のTransformerモデルが幅広い自然言語処理(NLP)タスクで高い性能を発揮できるようにする、二段階のトレーニングプロセスを開発しました。まず教師なし言語モデリングを用いて大量のデータでモデルを学習し、次に小規模なタスク固有の教師ありデータセットでファインチューニングすることで、システムは最小限の適応で複雑な問題を解決できます。
二段階トレーニングアーキテクチャ
システムは、教師なし事前学習に続く教師ありファインチューニングからなるパイプラインを利用します。このアプローチにより、モデルは特定のタスクに適用される前に言語の一般的な理解を構築できます。
- 教師なし事前学習: モデルは、言語モデリングをトレーニングシグナルとして非常に大量のデータで学習したTransformerです。この段階により、モデルは手動ラベル付けなしで生テキストから識別的特徴を学習できます。
- 教師ありファインチューニング: 事前学習されたコアモデルは、はるかに小規模な教師ありデータセットを使用して特定のタスクに適応されます。このプロセスは、モデルを一般的な言語モデルからタスク固有のソルバーへ移行させる際に、最小限の適応で済むようにします。
先行研究との比較
本研究は、教師なしおよび半教師あり学習におけるいくつかの既存手法を基盤とし、拡張しています。
- 半教師ありシーケンス学習: 本研究は、LSTMの教師なし事前学習に続く教師ありファインチューニングを用いて文書分類を改善する手法を確立しました。
- ULMFiT: 本研究は、データセットに依存しない単一のLSTM言語モデルをファインチューニングすることで、さまざまな文書分類データセットで最先端の性能を実現できることを示しました。
- ELMo: ELMoも事前学習を取り入れていますが、OpenAIのアプローチはタスクに依存しないのに対し、ELMoはタスク固有のアーキテクチャを使用して結果を得ています。
性能と能力
このモデルは、単純な文書分類を超えて、意味的類似性、読解、常識推論など幅広いタスクで高い性能を示します。
常識推論と世界知識
最も重要な結果の一つは、COPA、RACE、ROCStoriesデータセットにおけるモデルの性能です。モデルはこれらのデータセットで大幅に新しい最先端の結果を達成しました。これらのタスクは複数文の推論と豊富な世界知識を必要とすると考えられるため、結果はモデルが主に教師なし学習段階を通じてこれらの能力を向上させていることを示唆しています。
タスクの汎用性と最小限のチューニング
システムは効率性と一貫性を重視して設計されています。すべてのデータセットはエンセンブルせず単一の順方向言語モデルで処理され、報告された結果の大半は全く同じハイパーパラメータ設定で達成されました。これにより、結果を得るためにほとんどチューニングが不要であることが示されています。
評価されたデータセットとタスク例
モデルは以下を含む多様なNLPベンチマークでテストされました。
| データセット | タスク種別 | 例 |
|---|---|---|
| SNLI | 自然言語推論 | 2つの文が矛盾しているか(Contra.)あるいは含意関係にあるかを判定する。 |
| SciTail | 自然言語推論 | 文が別の文を含意するか、中立かを判定する。 |
| QNLI | 自然言語推論 | 文が文脈を含意しているかを判定する。 |
| RTE | 自然言語推論 | 文が別の文と矛盾しているかを判定する。 |
| STS-B | 意味的テキスト類似度 | 2つの文の類似度をスコア付けする(例:2/5)。 |
| QQP | Quora質問ペア | 2つの質問が同一かどうかを判定する。 |
| MRPC | Microsoft Research Paraphrase Corpus | 2つの文が同一かどうかを判定する。 |
| RACE | 読解 | テキスト本文に基づく選択式質問に回答する。 |
| ROCStories | 常識推論 | 最も妥当なストーリーの結末を選択する。 |
| COPA | 常識推論 | 出来事の原因または結果を特定する。 |
| SST-2 | 感情分析 | テキストを肯定的か否定的かに分類する。 |
| CoLA | 言語的受容性 | 文が文法的に受容できるかどうかを判定する。 |