OpenAIリサーチ:言語モデルが幻覚を起こす理由

幻覚は評価インセンティブによって駆動される

言語モデルが幻覚を起こすのは、現在の評価手法が不確実性について正直であることよりも推測を報酬するためです。モデルが主に正確さ(正しく答えた質問の割合)で採点される場合、必要な情報がないときでも正しい推測がスコアを上げる一方で、不確実性を示す(回答を控える)と得点がゼロになるため、推測するインセンティブが働きます。

OpenAIの研究は、エラーの方が回答を控えることよりも有害であることを示しています。OpenAI Model Specによれば、モデルが自信を持って誤った情報を提供するよりも、不確実性を示すか明確化を求める方が望ましいとされています。しかし、正確さのみを評価するスコアボードがモデルカードやリーダーボードで支配的であるため、開発者は控えるよりも推測するモデルを作る動機付けを受けています。

正確さと幻覚率の比較

gpt-5-thinking-miniOpenAI o4-mini の比較は、戦略的な推測と信頼性のトレードオフを示しています。

指標 gpt-5-thinking-mini OpenAI o4-mini
回答なし率(回答がない) 52% 1%
正解率(正しい回答) 22% 24%
エラー率(間違った回答) 26% 75%

OpenAI o4-mini はわずかに高い正解率を示しますが、回答を控えることがほとんどないため、エラー率(幻覚率)は著しく高くなります。

次単語予測における幻覚の起源

事実誤認は事前学習の統計的性質に起因します。事前学習では、モデルは「真偽」ラベルなしに膨大なテキストの次の単語を予測することで学習します。スペリングや括弧といった一貫したパターンは容易に学習され、スケールが大きくなるにつれてこれらのエラーは減少しますが、特定の人物の誕生日のような低頻度の事実はパターンだけから予測できません。

モデルは流暢な言語の正例しか見ておらず、全体分布を近似しなければならないため、無効とラベル付けされた例がない状態で有効な文と無効な文を区別するのが困難です。この統計的メカニズムが、モデルが信頼できない低頻度の事実を予測しようとしたときに起こる幻覚を引き起こします。

評価フレームワークの修正

幻覚を減らすために、OpenAIは広く使用されている正確さベースの評価を推測を抑制する方向に更新することを提案しています。具体的には:

  1. 自信のあるエラーに対する罰則 を不確実性よりも重くする。
  2. 不確実性の適切な表現に対して部分点を付与 する。

OpenAIは、いくつかの不確実性対応テストを追加するだけでは不十分であり、主要なスコアボード自体を謙虚さを報酬し、盲目的な推測を抑制するように再設計すべきだと主張しています。

幻覚に関する一般的な誤解への対処

OpenAIの研究は、AI幻覚の性質に関していくつかの重要な点を明らかにしています:

  • 正確さについて: 正確さが100%に達することは決してありません。実世界の質問の中には、モデルのサイズや推論能力に関係なく本質的に答えられないものがあるからです。
  • 必然性について: 幻覚は必然ではありません。モデルは不確実なときに回答を控えるよう設計可能です。
  • モデルサイズについて: 幻覚を回避するために必ずしも大規模モデルの知能が必要というわけではなく、小規模モデルの方が自分の限界を認識しやすい場合があります(例:特定の言語を知らない小規模モデルは単に回答を控える)。
  • 問題の性質について: 幻覚は「神秘的なバグ」ではなく、統計的メカニズムと評価報酬構造から生じるものです。
  • 測定について: 「幻覚評価」を作るだけでは不十分で、すべての主要評価指標が不確実性の表現を報酬するように更新される必要があります。

Sources