Anthropic Research: Language Models (Mostly) Know What They Know
Anthropicの研究によれば、大規模言語モデル(LLM)は、自身の主張の妥当性を評価し、質問に対して正しく回答できる可能性を予測できることが示されています。この能力により、モデルは不確実性を表現し、自身の知識の欠落を特定することが可能になります。これは、より誠実で信頼性の高いAIシステムを開発するための重要なステップです。
Model Calibration on Multiple Choice and True/False Questions
大規模言語モデルは、正しい形式で提供された場合、多様な多肢選択式および真偽判定問題において、適切にキャリブレーション(較正)されています。このキャリブレーションとは、モデルが予測する「正解である確率」が、実際の回答の正確性と密接に一致していることを意味します。モデルのサイズが大きくなるにつれて、このキャリブレーションは向上し、モデルが大きくなるほど自身の正確性をより良く推定できるというスケーリング効果が示されています。
Self-Evaluation of Open-Ended Sampling Tasks
オープンエンドなタスクにおいて、Anthropicの研究者は、モデルにまず回答を提案させ、次にその回答が正しい確率(「P(True)」と表記)を評価させるという方法で自己評価にアプローチしました。
主な知見は以下の通りです:
- Performance and Scaling: P(True) に関して、多様なタスクにわたって有望なパフォーマンス、キャリブレーション、およびスケーリングが見られます。
- Sample Consideration: 特定の回答の妥当性を予測する前に、モデルが自身で生成した回答の複数のサンプルを検討することを許可すると、自己評価の正確性が向上します。
Predicting Knowledge Probability (P(IK))
研究者たちは、特定の提案された回答を参照することなく、質問に対する答えを「知っている(I know)」確率、すなわち「P(IK)」を予測するようにモデルを訓練できるかどうかを調査しました。
P(IK) の予測に関する知見は以下の通りです:
- Generalization: モデルは P(IK) の予測において優れたパフォーマンスを発揮し、異なるタスク間での部分的な汎化性能を示します。
- Calibration Challenges: モデルは、全く新しいタスクに遭遇した際、P(IK) のキャリブレーションに苦戦します。
- Contextual Influence: コンテキスト内に関連するソース資料が提供されている場合、または数学の文章題に対してヒントが提供されている場合、予測される P(IK) の確率は上昇します。
Implications for AI Honesty
これらの観察結果は、LLMが自身の知識状態に関する内部表現を持っていることを示唆しています。これらの確率、すなわち P(True) と P(IK) を活用することで、モデルは自分が何を知らないかについてより誠実になるよう訓練することができ、ハルシネーション(幻覚)を減少させ、システム全体の信頼性を向上させることができます。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch