通过元认知解决 LLM 幻觉问题

大语言模型 (LLMs) 彻底改变了我们与信息交互的方式,但它们产生“幻觉”——即生成事实错误但听起来合理的文本——的倾向仍然是信任的关键障碍。随着这些模型被集成到高风险环境中,一种允许模型“知道自己知道什么”以及更重要的是“知道自己不知道什么”的机制变得至关重要。

幻觉的挑战

幻觉问题的核心在于 LLMs 作为下一个 token 的概率预测器的本质。它们的设计目标是最大化文本序列的可能性,而不是维持严格的内部真理表征。这往往导致模型生成听起来充满信心但完全是捏造的断言。

对于这一点,一种观点是对该问题进行语言学层面的界定。正如一些批评者所指出的,“幻觉”一词可能是一个误称。虽然幻觉是在缺乏刺激的情况下产生的感官知觉,但 LLM 的错误更类似于“胡说八道 (bullshitting)”——即有意或无意地生成对真理漠不关心的文本。这种区别很重要,因为它强调了模型并不是看到了不存在的东西,而是在遵循一条忽略事实准确性的概率路径。

元认知作为解决方案

元认知,即“对思考的思考”,是提议的前进方向。在 AI 背景下,元认知是指二阶处理,即模型在将输出呈现给用户之前,评估其自身的内部状态、置信度水平以及自身输出的可靠性。

通过实现元认知层,AI 可能能够识别其内部置信度较低的时机,或者有效地“复查”其自身的逻辑。这将使模型从一个简单的输出生成器转变为一个能够自我纠正并表达不确定性的系统,从而降低错误断言的频率。

内部元认知与外部元认知

技术从业者之间的一个关键争论是,这种元认知能力应该是 LLM 本身固有的特征,还是一个外部封装器 (wrapper)。

内部方法

内部方法将涉及训练模型以更好地校准其置信度。这需要架构上的更改或专门的训练数据,这些数据会对自信的谎言进行比以往更重的惩罚,而不是对诚实的无知承认。

外部控制框架 (Harness) 方法

或者,有人建议可以通过“控制框架 (harness)”来模拟元认知,即一个管理模型输出的外部系统。这种提议的架构将涉及:

  1. 输出监控:一个读取 LLM 初始输出的独立进程。
  2. 验证:使用研究子代理 (research sub-agent) 独立验证输出中提出的任何事实性主张。
  3. 精炼:如果事实性主张无法被独立验证,则重新措辞最终输出以传达不确定性。

这种外部方法允许更模块化的设计,其中验证代理可以使用基于事实的真理来源(如数据库或搜索引擎)来验证模型的主要生成过程。

结论

减少幻觉不仅是一个技术挑战,也是一个信任挑战。无论是通过向元认知的内部架构转变,还是通过实施外部验证控制框架,目标都是朝着能够沟通自身局限性的 AI 系统迈进。从概率性的 token 预测向能够进行自我评估的系统的转变,是迈向更可靠、更值得信赖的人工智能的本质所在。

Sources