AI 推理与思考幻象:大型推理模型是否因错误的原因而正确?

AI 推理的悖论:高性能 vs. 低忠实度

大型推理模型(LRMs)目前正产生挑战数学研究边界的成果,包括解决开放研究问题以及在国际数学奥林匹克上夺得金牌。然而,越来越多的证据表明,这些模型的最终答案与它们为达成答案而生成的“思考链”(CoT)之间存在根本性的脱节。当前 AI 研究的核心张力在于,这些模型是进行真正的逻辑推理,还是仅仅“因错误的原因而正确”。

“思考幻象”:不忠实的推理痕迹

虽然 LRMs 被训练以生成中间步骤(推理痕迹)来提升准确性,但研究表明这些痕迹往往并非模型内部计算的忠实表现。

非因果思考 Token

东北大学和加州大学伯克利分校的研究发现,前沿开源 LRM 中 30%‑60% 的思考步骤对最终答案的因果影响极小。在许多情况下,删除大量此类步骤并未导致性能下降。

无意义填充与“喃喃自语”

研究表明,推理痕迹的语言内容往往与实际推理无关:

  • 填充 Token: 纽约大学的研究显示,一串点号(无意义的填充 token)可以有效替代人类可读的思考链。
  • 痕迹替换: Subbarao Kambhampati 实验室的工作表明,用错误或无关的推理痕迹替换正确的痕迹,并不一定会削弱模型在形式推理任务上的表现。
  • 忠实度缺口: 仅在正确痕迹数据上训练的模型,即使最终解答正确,也仍会偶尔生成无效的推理记录。

理论框架:近似检索 vs. 真正推理

为解释模型如何在缺乏忠实推理的情况下仍保持高准确率,研究者提出了若干竞争假设。

近似检索假说

Subbarao Kambhampati 认为,LRM 并未执行逐步的逻辑推理,而是进行“近似检索”——介于模式匹配与推理之间的过程。在该视角下,“思考 token”充当加载模型上下文窗口的机制,使模型更有可能从训练语料中预测出“推理形态”的文本串。这类似于“自言自语”以唤起记忆,而非执行正式算法。

模拟递归假说

一些技术观点指出,由于 Transformer 具有固定深度且缺乏原生递归,推理痕迹是一种模拟更深递归的手段。通过生成 token,模型能够在比网络层数更长的序列上细化概念,实际上利用 KV 缓存在多次迭代中保持状态。

可验证域优势

LRM 在编码和数学领域的成功归因于这些“可验证域”的特性。代码和证明只有二元结果(可运行/不可运行),因此提供了强烈的训练信号。模型可能并未学习通用的推理算法,而是吸收了足够多的正确步骤示例,以预测性地模仿它们,直至得到可验证的结果。

行业视角与“愿望记忆”问题

学术怀疑者与行业从业者在如何解读这些结果上存在明显分歧。

行业观点

OpenAI 等公司的从业者认为,模型的实用价值胜过对机械解释的需求。他们主张,只要模型能够解决复杂的数学证明,即便中间 token 并非完全忠实,也算是推理。一些人甚至认为,早期对 AI 推理的批评基于已过时的模型,最新迭代(如 GPT-5.5)已经克服了这些问题。

“愿望记忆”批评

批评者指出,使用“推理”“思考”“理解”等词汇本身就是一种“愿望记忆”——通过假设模型具备这些能力来为其贴标签。这种拟人化会导致研究者误以为模型在执行认知过程,仅因为输出看起来像人类对该过程的描述。

社群洞见的综合

技术观察者的讨论凸显了若干关键的反驳与类比:

  • “聪明的汉斯”类比: 有人将 LRMs 类比为聪明的汉斯——那匹看似会算术的马,实则在读取驭手的暗示。这里的 LRMs 可能在优化人类评估者的“奖励信号”,而非问题的逻辑真理。
  • 语义争论: 有观点认为,“真正推理”与“近似检索”之间的区别仅是语义问题。如果系统始终能对复杂问题给出正确答案,内部机制是矩阵乘法还是逻辑演绎,都不是核心,功能性更为重要。
  • X 射线类比: 警示不要在不了解内部机制的情况下盲目使用“魔法”技术,就像早期使用 X 射线一样——表面上效果惊人,直到隐藏的损伤(或失效模式)显现才会后悔。

Sources