TruthfulQA: モデルがどのように人間の誤った情報を模倣するかを測定する

OpenAIは、大規模言語モデル(LLM)が真実の回答を生成するか、それとも単にトレーニングデータに含まれる一般的な人間の誤解を模倣しているだけなのかを評価するために設計されたベンチマーク、TruthfulQAを導入しました。この研究は、モデルの真実性における重大なギャップを浮き彫りにし、より大規模なモデルほど、人間が生成したテキストに蔓延している誤った信念をより効果的に模倣してしまうため、真実性が低くなることが多いことを明らかにしています。

TruthfulQA ベンチマークの設計

TruthfulQAは、健康、法律、金融、政治などの重要度の高いドメインを含む、38の異なるカテゴリにわたる817の質問で構成されています。質問は、人間が誤った信念や誤解を頻繁に持つ領域をターゲットにするように特別に作成されています。高いスコアを獲得するためには、モデルは一般的ではあるが不正確な回答を生成することを避けなければならず、単にトレーニングされた人間が生成したテキストのパターンを模倣することから脱却することが求められます。

モデルのパフォーマンスと人間のベースライン

OpenAIは、GPT-3、GPT-Neo/J、GPT-2、およびT5ベースのモデルを含む、いくつかのモデルをテストしました。結果は、AIモデルと人間の間に大きなパフォーマンスの差があることを示しています。

  • 人間のパフォーマンス: 人間は94%の真実性を達成しました。
  • モデルのパフォーマンス: 最も優れたパフォーマンスを示したモデルは、質問のわずか58%においてのみ真実でした。

モデルは、一般的な誤解を反映した誤った回答を頻繁に生成しました。研究者たちは、これは人間のユーザーを欺く可能性があると指摘しています。

モデルのサイズと真実性の関係

モデルのサイズが大きくなるにつれてパフォーマンスが向上するのが一般的な多くの自然言語処理(NLP)タスクとは異なり、TruthfulQAは逆の関係を示しました。最も大規模なモデルは、一般的に真実性が最も低いものでした。

この傾向は、より大規模なモデルほど、人間の誤った情報を(トレーニング分布を)より正確に模倣する能力が高いため、発生します。その結果、モデルのサイズを拡大するだけでは、真実性を向上させるための効果的な戦略ではありません。

モデルのトレーニングへの影響

真実性はスケールによって創発される特性ではないため、OpenAIは、モデルの精度を向上させるにはトレーニングの目的をシフトさせる必要があると示唆しています。研究者たちは、モデルが人間の誤解を模倣する可能性を低減するために、ウェブベースのテキストの単純な模倣ではない他の目的を使用してモデルを微調整(fine-tuning)することが必要であると主張しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch