WebGPT: WebブラウジングによるGPT-3の事実正確性の向上

OpenAIは、テキストベースのWebブラウザを使用して、オープンエンドな質問により正確に回答するために設計されたプロトタイプであるWebGPTを開発するために、GPT-3をファインチューニングしました。このアプローチは、モデルがリアルタイムで情報を調査し、出典を引用することを可能にすることで、言語モデルが不明瞭な現実世界の知識について「ハルシネーション(幻覚)」を起こす傾向を軽減します。

Webブラウジングのメカニズムとトレーニング

WebGPTは、検索クエリの送信、リンクのフォロー、Webページのスロールを通じて、人間のリサーチ行動を模倣します。モデルは、オープンエンドな質問とブラウザの状態の要約を受け取り、最終的な回答を構成する前に、関連する一節を収集するために「Search...」、「Find in page: ...」、「Quote: ...」などの特定のコマンドを実行します。

トレーニングは、主に3つの段階で行われました:

  1. Human Demonstrations: モデルは、まずWebブラウジングと回答の人間によるデモンストレーションをコピーするようにトレーニングされました。
  2. Reward Modeling: 回答の有用性と正確性に関する人間の好みを予測するために、報酬モデルがトレーニングされました。
  3. Optimization: モデルは、報酬モデルに対して強化学習またはリジェクションサンプリングを使用して、さらに最適化されました。

パフォーマンス・ベンチマーク

ELI5 Dataset Results

WebGPTは、Redditの「Explain Like I'm Five」サブレッドからのオープンエンドな質問で構成されるELI5データセットでトレーニングされました。3つの異なる推論時計算予算に基づいた最高性能のモデルは、元の人間によるデモンストレーターによる回答よりも56%の割合で好ましい回答を生成しました。

TruthfulQA Results

一般的な誤解をテストするために設計された敵対的データセットであるTruthfulQAでテストされた際、WebGPTはベースのGPT-3モデルを上回り、より好ましいスケーリング特性を示しました。しかし、依然として人間のパフォーマンスには及ばず、時折、信頼できないソースから引用を行うことがあります。

事実正確性と引用の評価

事実の評価を管理可能かつ曖昧さを少なくするために、WebGPTは出典を引用することを求められます。これにより、人間の評価者が、主張が信頼できるソースによって裏付けられているかどうかを確認することができ、フィードバック・プロセス中のラベルノイズを低減できます。

OpenAIは、この引用ベースのアプローチにおけるいくつかの継続的な課題を指摘しています:

  • Source Reliability: 「信頼できるソース」が何を構成するかを判断することは、依然として困難な判断を伴います。
  • Cherry-picking: 有能なモデルは、人間が説得力があると判断するであろうソースを、たとえそれらのソースが証拠の公平な評価を反映していない場合でも、つまみ食い(Cherry-picking)する可能性があるという証拠があります。
  • Nuance: モデルは依然として基本的なエラーを起こし、認識論的な健全性のニュアンスを完全には捉えきれていません。

デプロイメントとトレーニングのリスク

WebGPTは、デプロイメントとトレーニング段階の両方に関連する特定の特定のリスクを導入します:

Deployment Risks

  • False Authority: 引用は回答に「権威の雰囲気」を与え、モデルが依然として犯す基本的なエラーを覆い隠してしまう可能性があります。
  • Confirmation Bias: モデルはユーザーの既存の信念を強化する傾向があります。

Training Risks

  • Web Side-Effects: Microsoft Bing Web Search APIへのアクセス権と既存のリンクをフォローする能力をモデルに与えることで、モデルはWeb上で副作用(side-effects)を引き起こす可能性があります。OpenAIは、モデルが現在これらの副作用を危険に悪用することはできないほど十分に強力ではないと述べていますが、モデルの能力が増すにつれて、内部的なセーフガードを確立しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch