OpenAI GPT-2 リリースとその影響
OpenAIは、一貫したパラグラフのテキストを生成し、いくつかの言語モデリングベンチマークで最先端のパフォーマンスを達成する、大規模な教師なし言語モデルであるGPT-2を開発しました。このモデルは、タスク固有のトレーニングなしで、 rudimentaryな読解、機械翻訳、質問応答、および要約を行う能力を示しています。
テクニカルアーキテクチャとトレーニング
GPT-2は、元のGPTモデルの直接的なスケールアップであり、パラメータ数が10倍以上、トレーニングデータ量も10倍以上です。
- モデルスケール: フルモデルには15億のパラメータがあります。
- トレーニング目的: モデルは、テキスト内のすべての前の単語に基づいて次の単語を予測するだけでトレーニングされました。
- トレーニングデータ: GPT-2は、Redditからのアウトバウンドリンクによってキュレートされた800万ウェブページ(約40GBのインターネットテキスト)のデータセットでトレーニングされました。これにより、少なくとも3のカルマを獲得したリンクを使用して多様性と品質を確保しました。
- アーキテクチャ: トランスフォーマーアーキテクチャに基づいています。
ゼロショット機能とパフォーマンス
GPT-2は、「ゼロショット」設定において、さまざまなドメイン固有の言語モデリングタスクで最先端のスコアを達成します。これは、それらのタスクに特化したデータでトレーニングされておらず、最終テストとしてのみ評価されたことを意味します。
言語モデリングベンチマーク
GPT-2は、Wikipedia、ニュース、または書籍などのドメイン固有のデータセットでトレーニングされたモデルよりも、以下のベンチマークで優れた成績を収めました:
| データセット | メトリック | GPT-2 結果 | 以前の記録 | 人間 |
|---|---|---|---|---|
| Winograd Schema Challenge | 精度 (+) | 70.70% | 63.7% | 92%+ |
| LAMBADA | 精度 (+) | 63.24% | 59.23% | 95%+ |
| Children’s Book Test (Common Nouns) | 精度 (+) | 93.30% | 85.7% | 96% |
| Children’s Book Test (Named Entities) | 精度 (+) | 89.05% | 82.3% | 92% |
| Penn Tree Bank | パープレキシティ (–) | 35.76 | 46.54 | unknown |
| WikiText-2 | パープレキシティ (–) | 18.34 | 39.14 | unknown |
| enwik8 | 文字あたりのビット数 (–) | 0.93 | 0.99 | unknown |
| text8 | 文字あたりのビット数 (–) | 0.98 | 1.08 | unknown |
| WikiText-103 | パープレキシティ (–) | 18.34 | 18.3 | unknown |
一般的な言語タスク
専門的なシステムにおいて最先端に達していないものの、GPT-2は、ファインチューニングなしで訓練済みモデルに特定のプロンプトを与えることにより、読解、要約、翻訳などのタスクを実行できます。
テキスト生成と障害モード
GPT-2は、任意の入力プロンプトに基づいて現実的で一貫したテキストの継続を生成できます。ただし、モデルはいくつかの障害モードを示します:
- 反復テキスト: モデルは反復的なシーケンスを生成する可能性があります。
- 世界モデリングの失敗: モデルは時折、論理的に不可能なシナリオ(例えば、水中で火災が発生していることについて書く)を生成します。
- 不自然なトピック切り替え: モデルはトピックを急に切り替える可能性があります。
OpenAIは、パフォーマンスがトピックによって異なることを指摘しています。トレーニングデータで高い頻度を示すトピック(例えば、Brexit、ロード・オブ・ザ・リング)についてはモデルがより成功しやすく、高度に技術的または奥深いコンテンツについては性能が低くなります。
ポリシーへの影響と悪用リスク
OpenAIは、大規模言語モデルに対するいくつかの潜在的な有益な応用と悪用の可能性を特定しています:
潜在的な利益
- AIライティングアシスタント
- 有能なダイアログエージェント
- 言語間の教師なし翻訳
- 音声認識システムの向上
潜在的な悪用
- 誤解を招くニュース記事の生成
- オンラインでのなりすまし
- 自動コンテンツ生成: ソーシャルメディア向けの悪意のある、偽造された、またはスパム/フィッシングコンテンツの生産を自動化する
OpenAIは、これらの技術が偽コンテンツの生成コストと偽情報キャンペーンの実行コストを削減し、一般市民がオンラインテキストに対してより懐疑的になる必要があると警告しています。
リリース戦略:段階的開示
大規模な欺瞞的または悪意のある言語生成の可能性に関する懸念から、OpenAIは段階的リリースを通じて責任ある開示の実験を実施しました:
- 初回リリース: 最初に、GPT-2のはるかに小さいバージョン(117Mパラメータ)とサンプリングコードのみがリリースされました。
- 中間アップデート(2019年5月): より大きな345Mパラメータバージョンがリリースされました。
- パートナー共有: 762Mおよび1.5Bバージョンは、社会の準備を向上させるため、AIおよびセキュリティコミュニティのパートナーに限定して共有されました。
OpenAIは、フルデータセット、トレーニングコード、または1.5Bモデルの重みを一般公開しませんでした。この戦略は、コミュニティにモデルの特性を評価し、各リリース段階の影響を評価する時間を与えることを意図していました。