「魔法提示」的幻象:破解 o3 GeoGuessr 現象

在快速演變的大型語言模型(LLM)領域中,常出現一種敘事:所謂的「魔法提示」。這些高度詳細、迭代式的指令據稱能解鎖模型內隱藏的能力。最近的一個例子涉及 OpenAI 的 o3 模型以及它在地理定位方面的驚人表現——本質上是透過辨識照片的精確位置來玩高風險的 GeoGuessr 遊戲。

當使用者發現 o3 能以驚人的準確度定位毫無特徵的景觀時,社群迅速將此成功歸因於一個精緻的「GeoGuessr 協議」提示。然而,嚴謹的基準測試揭示了另一番故事,突顯了「感覺式」評估與實證資料之間的關鍵落差。

實驗:感覺 vs. 基準

認為複雜提示是 o3 地理定位成功關鍵的觀點主要基於軼事證據。使用者報告了成功案例,而該提示本身是一個迭代的傑作,透過詢問模型如何避免先前的錯誤而構建。為了測試這個精心設計的提示是否真的提升了表現,我們使用 200 張來自 Wikimedia Commons、Geograph Britain and Ireland 以及 iNaturalist 的圖像建立了一個基準測試。

結果令人驚訝:基本提示的平均表現實際上優於「魔法」GeoGuessr 提示。

提示 n 中位數 km 平均 km 第25百分位 km 第75百分位 km ≤25 km ≤100 km ≤500 km ≤1000 km
預設 200 83.2 440.7 16.4 221.9 58 109 176 182
GeoGuessr 提示 200 102.3 481.9 18.5 277.8 59 99 172 180

儘管 GeoGuessr 提示的字數是預設提示的十倍,卻未提升準確度。在多項指標上,預設提示的猜測更接近實際位置。

提示心理學

此差異揭示了 AI 互動中的常見陷阱:將模型本身的能力歸因於使用者的提示技巧。當模型已經在某項任務上表現優秀時,冗長的提示不會顯著阻礙表現,卻會產生一種心理上的「控制幻覺」。

正如作者所指出的,模型容易迎合使用者的暗示;如果你問 LLM 某個特定的提示調整是否有幫助,它很可能會說「有」,即使該變更與結果無關。這形成了一個回饋迴路,使使用者相信自己在「工程」出模型原本就具備的能力。

重要的反駁點與限制

雖然此基準提供了有力的數據點,社群仍提出了關於測試集有效性的關鍵問題:

  • 資料污染:部分批評者認為使用 Wikipedia 與 Wikimedia Commons 的圖像存在問題,因為這些圖像很可能已被納入模型的訓練資料。若模型之前已見過該圖像及其相關元資料,它並非在「猜測」——而是直接回憶。
  • 推理成本:複雜提示僅將思考時間延長約一秒,暗示模型可能立即辨識出圖像,無需依賴詳細的協議。

能力的退化

或許最引人注目的是,地理定位能力似乎是模型特有的,而非普遍提升的趨勢。當以相同基準測試較新模型(gpt-5.4 與 gpt-5.5)時,結果顯示其表現相較於 o3 有顯著下降。

執行 中位數 km 平均 km ≤25 km ≤100 km ≤500 km
o3 預設 83.2 440.7 58 109 176
o3 GeoGuessr 102.3 481.9 59 99 172
gpt-5.4 預設 163.3 638.9 26 74 148
gpt-5.5 預設 156.5 645.9 39 77 161

這暗示使 o3 在地理定位上表現卓越的架構或訓練特性,未被後續版本保留。使用者也指出,o3 能以 Python 操作與放大照片以進行辨識的能力是其獨特優勢,而較新模型則缺乏此功能。

結論:嚴謹的重要性

「GeoGuessr 提示」的傳奇是 AI 社群的一個警示故事。在充斥大膽聲稱與病毒式推文的時代,報導「突破」往往比呈現細緻的現實更具誘因。從「感覺」走向基準測試是了解 AI 真正能做什麼——更重要的是,了解它不能做什麼的關鍵步驟。

Sources