OpenAI GPT-3: 言語モデルをFew-Shot Learnerとして活用する

概要

OpenAIは、1750億個のパラメータを持つ自己回帰型言語モデルであるGPT-3を導入しました。このモデルは、言語モデルのスケールを拡大することで、タスクに依存しないFew-Shot性能が大幅に改善されることを示しており、勾配更新やファインチューニングを行うことなく、テキストによる対話を通じて提供されるわずかな例示や単純な指示に基づいて、新しい言語タスクを実行することが可能です。

技術的アーキテクチャとスケーリング

GPT-3は、1750億個のパラメータを特徴とする自己回帰型言語モデルであり、これは従来の非スパースな言語モデルの10倍に相当します。パラメータ数をスケーリングすることで、OpenAIの研究者たちは、通常は数千の例示を必要とするタスク固有のファインチューニング用データセットなしで、タスクを実行するモデルの能力が向上することを発見しました。

Few-Shot学習能力

GPT-3は、勾配更新やファインチューニングなしでNLPタスクに適用されます。その代わりに、タスクとFew-Shotのデモンストレーションは、純粋にテキストによる対話を通じて指定されます。このアプローチにより、モデルは以下のような多様なタスクを実行できます:

  • 翻訳と質問応答: 標準的なNLPデータセットにおいて強力なパフォーマンスを発揮します。

  • Clozeタスク: テキスト内の欠落した単語を補完します。

  • 即時推論 (On-the-fly Reasoning): モデルは3桁の算術計算や単語の並べ替えを行うことができます。

  • ドメイン適応: 文中で新しい単語を使用します。

人間のようなテキスト生成

主要な知見の一つは、GPT-3が、人間の評価者が人間によって書かれた記事と区別することが困難なニュース記事を生成できることです。この能力は、モデルが非常に一貫性があり、もっともらしいテキストを生成する能力をハイライトしていますが、研究者たちは、この高精度な生成に関連するより広範な社会的影響についても認めています。 \n## 限界と課題

その規模にもかかわらず、GPT-3は依然として一部のデータセットで苦戦しており、大規模なウェブコーパスでの学習に関連する手法上の問題に直面しています。これは、スケーリングがFew-Shot性能を向上させる一方で、スケール単体ではすべてのNLPの課題に対する完全な解決策ではないことを示しています。

Sources