メタ認知を通じてLLMのハルシネーションに対処する

大規模言語モデル(LLM)は、情報の扱い方に革命をもたらしましたが、事実とは異なるものの、もっともらしく聞こえるテキストを生成してしまう「ハルシネーション(幻覚)」の傾向は、信頼における重大な障壁として残っています。これらのモデルが高リスクな環境に統合されるにつれ、モデルが「自分が何を知っているか」を知り、さらに重要なことに「自分が何を知らないか」を知るためのメカニズムの必要性が極めて重要になっています。

ハルシネーションの課題

ハルシネーション問題の核心は、LLMが次のトークンを予測する確率的な予測器であるという性質にあります。これらは、テキストのシーケンスの尤度を最大化するように設計されており、真実の厳密な内部表現を維持するように設計されているわけではありません。このことが、モデルが完全に捏造された、自信に満ちた主張を生成してしまうことにつながることがよくあります。

これに関する一つの視点は、問題の言語的な枠組みです。一部の批評家が指摘するように、「ハルシネーション」という用語は誤用である可能性があります。ハルシネーションが刺激のない状態での感覚的な知覚であるのに対し、LLMの誤りは「bullshitting(デタラメを言うこと)」、つまり真実に対して無関心なテキストの意図的または非意図的な生成に近いものです。この区別は重要です。なぜなら、それはモデルがそこにないものを見ているのではなく、事実の正確さを無視して確率的な経路を辿っているに過ぎないことを浮き彫りにするからです。

メタ認知による解決策

メタ認知、すなわち「思考についての思考」が、提案されている前進への道です。AIの文脈において、メタ認知とは、モデルがユーザーに提示される前に、自身の内部状態、信頼レベル、および自身の出力の信頼性を評価する二次的な処理を指します。

メタ認知レイヤーを実装することで、AIは自身の内部的な信頼度が低いときを特定したり、自身の論理を効果的に「再確認」したりできる可能性があります。これにより、モデルは単なる出力生成器から、自己修正を行い、不確実性を表現できるシステムへと移行し、それによって誤った主張の頻度を減少させることができます。

内部メタ認知 vs. 外部メタ認知

技術的な実務家の間での主要な議論は、このメタ認知能力がLLM自体の固有の機能であるべきか、それとも外部のラッパーであるべきかという点です。

内部的アプローチ

内部的アプローチでは、モデルが自身の信頼度をより適切に校正(キャリブレーション)できるようにトレーニングすることを含みます。これには、アーキテクチャの変更や、正直な無知の告白よりも、自信に満ちた嘘をより重く罰するような、専門化されたトレーニングデータが必要になります。

外部ハーネス・アプローチ

あるいは、一部の人々は、メタ認知が「ハーネス(制御装置)」、つまりモデルの出力を管理する外部システムを通じてシミュレートできると提案しています。この提案されているアーキテクチャには、以下が含まれます:

  1. Output Monitoring: LLMの初期出力を読み取る別のプロセス。
  2. Verification: 出力に含まれる事実的な主張を独立して検証するために、リサーチ・サブエージェントを使用すること。
  3. Refinement: 事実的な主張が独立して検証できない場合、不確実性を伝えるために最終的な出力を言い換えること。

この外部的アプローチは、よりモジュール化された設計を可能にし、検証エージェントが根拠となる真実のソース(データベースや検索エンジンなど)を使用して、モデルの主要な生成プロセスを検証することを可能にします。

結論

ハルシネーションを減らすことは、単なる技術的な課題ではなく、信頼の課題です。メタ認知への向かう内部的なアーキテクチャのシフト、あるいは外部の検証ハーネスの実装、のいずれかを通じて、目標は、自身の限界を伝えることができるAIシステムへと移行することです。確率的なトークン予測から、自己評価が可能なシステムへの移行は、より信頼性が高く、信頼できる人工知能への移行の本質です。

Sources