コンセンサス・ギャップ:なぜ最先端LLMは現実世界のファクトチェックにおいて67%で意見が分かれるのか

客観的な真実の裁定者としての大型言語モデル(LLM)の約束は、マーケティング資料やベンチマークのリーダーボードで頻繁に謳われています。しかし、ベンチマークは、トレーニングセットにリークしている可能性のある静的なデータセットに依存していることが多く、推論ではなく暗記を通じて正確性の偽装を作り出しています。このベールを突き破るため、Lenz Researchは、ファクトチェック・プラットフォームにユーザーから提出された1,000件の現実世界の主張を用いて研究を行いました。これらの主張は、新鮮でオーガニックなものであり、公開されているトレーニングコーパスには存在しません。

結果は深刻です:67%の主張において、世界をリードする5つの最先端LLMの間で意見の相違が生じました。 このギャップは、私たちが精選されたベンチマークを超えて、人間の主張という混沌とした現実に踏み出すとき、「最先端」は決して統一された戦線ではないことを示唆しています。

意見の相違の解剖学

この研究では、判定のために4つのバケット(区分)を用いたルーブリックを使用しました:True(真実)、Mostly True(大部分は真実)、Misleading(誤解を招く)、およびFalse(偽り)。5つのモデル(GPT-5.4, Claude Opus 4.7, Gemini 3 Pro, Gemini 3 Pro + Search, および Sonar Pro)に対して同じ1,000件の主張を提示することで、研究者はいくつかの重要な乖離のパターンを特定しました。

1. 反対意見の頻度

5つのモデルすべてにおいて満場一致の合意が得られた主張は、わずか33%でした。残りの67%では、少なくとも1つのモデルが多数派と異なる意見を持ち、あるいは多数派が形成されませんでした。これは、エラーの数学的な下限を示しています:もし多数派が常に正しいと仮定するならば、少なくとも1つのモデルは全主張の67%において誤っていることになります。

2. ニュアンス vs. 実質的な対立

すべての意見の相違は等価ではありません。研究者は、「ニュアンス」の差(True vs. Mostly Trueのような1バケットの差)と、「実質的」な相違(True vs. Misleading または True vs. Falseのような2バケット以上の差)を区別しました。

  • ニュアンスのみ: 主張の33%。
  • 実質的または極端な対立: 主張の34%。

これは、全ケースの3分の1以上において、モデルが単に真実の「程度」について意見が分かれているのではなく、真実そのものの「性質」について意見が分かれていることを意味します。

3. 「中間バケット」の断片化

最も衝撃的な発見の一つは、モデルがルーブリックの中間部分で最も苦戦していることです。パネルは決定的な「True」または「False」の判定に収束することが多い一方で、「Mostly True」や「Misleading」についてはほとんど一致しません。

多数派が「Mostly True」と投票した主張のうち、満場一致だったものは0%でした。同様に、「Misleading」の多数派において満場一致だったのはわずか5%でした。これは、ニュアンスの境界線がモデルのアーキテクチャによって極端に異なって解釈されていることを示唆しています。

モデル固有の挙動

研究では、異なるモデルがどのように判定を下すかについて、異なる「パーソナリティ」があることが明らかになりました:

  • 極端化: Gemini 3 Proは、判定を両極端(True/False)に集中させる傾向があり、中間バケットへの割り当ては非常に少なくなりました。
  • 分布: Claude Opus 4.7 と Sonar Pro は、「Mostly True」および「Misleading」のカテゴリーを使用する傾向がより高かったです。
  • ピア・アグリーメント(仲間との合意): 最も高い合意は Gemini 3 Pro とその検索拡張版(75%)の間で見られましたが、最も低い合意は Claude Opus 4.7 と Gemini 3 Pro(53%)の間で見られました。

批判的な対抗点と限界

データは一貫性の欠如を示していますが、Hacker Newsの技術的な観察者たちからのコミュニティの反応は、いくつかの方法論的な懸念を指摘しており、それらは不可欠な文脈を提供します。

「強制的な選択」の誤謬

主な批判の一つは、「Abstain」(棄権)または「Unknown」(不明)という選択肢がないことです。現実世界のファクトチェックにおいて、最も誠実な回答は、しばしば「分かりません」です。4つのバケットのいずれかを選択することを強制することで、この研究は、モデルの事実知識ではなく、モデルが判定を捏造(ハルシネーション)する傾向を測定している可能性があります。

「検索ツールがない場合、それに対する唯一の正しい答えは、『この主張は検証不能です』であり、それが選択肢になかったことが問題です。」 — @simonw

ルーブリックの曖昧さ

批判者たちは、意見の相違はプロンプトにおける詳細なルーブリックの欠如に起因する可能性があると主張しています。何が「Mostly True」であり、何が「Misleading」を構成するのかという明確な定義がなければ、モデルはこれらの用語の内部的で、乖離した解釈に頼らざるを得なくなります。

「事実」の性質

コーパス内のいくつかの主張は、根本的に証明不可能であったり、解釈の対象であったりする可能性があります。例えば、歴史的な境界線(例:ある都市が1934年に特定の州に含まれていたかどうか)や、将来の予測(例:AIによる雇用喪失)に関する主張は、バイナリな事実ではなく、フレーミングや視点の問題です。

結論:単一のオラクル(神託)のリスク

Lenz Researchの研究から得られる全体的な教訓は、いかなる単一のLLMを真実の決定的なオラクルとして扱うことへの警告です。地球上で最も有能なモデルが、現実世界の主張の3分の2において意見が分かれるとき、critical verification(決定的な検証)において単一のモデルに依存するリスクは非常に高いと言えます。

研究が示唆するように、今後の道は、単一の「完璧な」モデルを求めることではなく、むしろ集団的な機械知能の構築です。複数のモデルを活用し、彼らの意見の相違をクロスリファレンスし、人間が最終的な判断を下すために必要な証拠を提供できるシステムです。

Sources