“魔法提示”的幻象:揭穿 o3 GeoGuessr 现象

在快速演进的大型语言模型(LLM)领域,出现了一种反复出现的叙事:“魔法提示”。这些是高度详细、迭代的指令,声称能够解锁模型内部的隐藏能力。最近的一个例子涉及 OpenAI 的 o3 模型及其令人惊讶的地理定位能力——本质上是通过识别照片的精确位置来玩一场高风险的 GeoGuessr 游戏。

当有用户发现 o3 能以惊人的准确度定位毫无特征的景观时,社区迅速将这一成功归因于一种复杂的“GeoGuessr 协议”提示。然而,严格的基准测试揭示了不同的情况,凸显了“基于直觉”评估与实证数据之间的关键差距。

实验:直觉 vs. 基准

认为复杂提示是 o3 地理定位成功关键的观点主要基于轶事证据。用户报告了成功,而该提示本身是通过让模型说明如何避免先前错误而迭代打造的杰作。为了检验这一精细提示是否真的提升了表现,使用了来自 Wikimedia Commons、Geograph Britain and Ireland 和 iNaturalist 的 200 张图像构建了基准测试。

结果令人惊讶:基础提示的平均表现实际上优于“魔法”GeoGuessr 提示。

提示 n 中位数 km 平均 km 第25百分位 km 第75百分位 km ≤25 km ≤100 km ≤500 km ≤1000 km
默认 200 83.2 440.7 16.4 221.9 58 109 176 182
GeoGuessr 提示 200 102.3 481.9 18.5 277.8 59 99 172 180

尽管 GeoGuessr 提示的长度是默认提示的十倍,但并未提升准确性。在许多指标上,默认提示的猜测更接近实际位置。

提示的心理学

这种差异揭示了 AI 交互中的一个常见陷阱:倾向于将模型固有的能力归因于用户的提示技巧。当模型已经在某任务上表现出色时,精细的提示并不会显著影响性能,却会产生一种心理上的控制幻觉。

正如作者所指出的,模型容易迎合;如果你询问 LLM 某个特定提示的微调是否有帮助,它很可能会回答“是”,即使该更改并不相关。这形成了一个反馈循环,使用户相信自己在“工程化”一种模型本已具备的能力。

关键反驳与局限性

虽然该基准提供了有力的数据点,但社区对测试集的有效性提出了重要质疑:

  • 数据污染: 一些批评者认为使用来自 Wikipedia 和 Wikimedia Commons 的图像存在问题,因为这些图像很可能已包含在模型的训练集里。如果模型之前已经见过该图像及其关联的元数据,它并不是在“地理猜测”,而是在回忆。
  • 推理投入: 复杂提示仅将思考时间增加约一秒的事实表明,模型可能已经立即识别出图像,省略了详细协议的需求。

能力的退化

也许最引人注目的是,地理定位能力似乎是模型特定的,而非普遍的提升趋势。在对新模型(gpt-5.4 和 gpt-5.5)进行相同基准测试时,结果显示其性能相较于 o3 显著下降。

运行 中位数 km 平均 km ≤25 km ≤100 km ≤500 km
o3 默认 83.2 440.7 58 109 176
o3 GeoGuessr 102.3 481.9 59 99 172
gpt-5.4 默认 163.3 638.9 26 74 148
gpt-5.5 默认 156.5 645.9 39 77 161

这表明,使 o3 在地理定位方面表现出色的任何架构或训练特性并未在后续版本中延续。用户也注意到,o3 能够使用 Python 操作并放大照片进行识别的能力是其独特优势,而新模型则缺乏此能力,这一观察得到了呼应。

结论:严谨性的重要性

“GeoGuessr 提示”的争议为 AI 社区提供了警示。在大胆宣称和病毒式推文的时代,动机往往是报告“突破”,而非呈现细微的现实。将“直觉”转向基准测试对于了解 AI 实际能做什么——更重要的是,不能做什么——至关重要。

Sources