「魔法提示」的幻象:破解 o3 GeoGuessr 現象
在快速演變的大型語言模型(LLM)領域中,常出現一種敘事:所謂的「魔法提示」。這些高度詳細、迭代式的指令據稱能解鎖模型內隱藏的能力。最近的一個例子涉及 OpenAI 的 o3 模型以及它在地理定位方面的驚人表現——本質上是透過辨識照片的精確位置來玩高風險的 GeoGuessr 遊戲。
當使用者發現 o3 能以驚人的準確度定位毫無特徵的景觀時,社群迅速將此成功歸因於一個精緻的「GeoGuessr 協議」提示。然而,嚴謹的基準測試揭示了另一番故事,突顯了「感覺式」評估與實證資料之間的關鍵落差。
實驗:感覺 vs. 基準
認為複雜提示是 o3 地理定位成功關鍵的觀點主要基於軼事證據。使用者報告了成功案例,而該提示本身是一個迭代的傑作,透過詢問模型如何避免先前的錯誤而構建。為了測試這個精心設計的提示是否真的提升了表現,我們使用 200 張來自 Wikimedia Commons、Geograph Britain and Ireland 以及 iNaturalist 的圖像建立了一個基準測試。
結果令人驚訝:基本提示的平均表現實際上優於「魔法」GeoGuessr 提示。
| 提示 | n | 中位數 km | 平均 km | 第25百分位 km | 第75百分位 km | ≤25 km | ≤100 km | ≤500 km | ≤1000 km |
|---|---|---|---|---|---|---|---|---|---|
| 預設 | 200 | 83.2 | 440.7 | 16.4 | 221.9 | 58 | 109 | 176 | 182 |
| GeoGuessr 提示 | 200 | 102.3 | 481.9 | 18.5 | 277.8 | 59 | 99 | 172 | 180 |
儘管 GeoGuessr 提示的字數是預設提示的十倍,卻未提升準確度。在多項指標上,預設提示的猜測更接近實際位置。
提示心理學
此差異揭示了 AI 互動中的常見陷阱:將模型本身的能力歸因於使用者的提示技巧。當模型已經在某項任務上表現優秀時,冗長的提示不會顯著阻礙表現,卻會產生一種心理上的「控制幻覺」。
正如作者所指出的,模型容易迎合使用者的暗示;如果你問 LLM 某個特定的提示調整是否有幫助,它很可能會說「有」,即使該變更與結果無關。這形成了一個回饋迴路,使使用者相信自己在「工程」出模型原本就具備的能力。
重要的反駁點與限制
雖然此基準提供了有力的數據點,社群仍提出了關於測試集有效性的關鍵問題:
- 資料污染:部分批評者認為使用 Wikipedia 與 Wikimedia Commons 的圖像存在問題,因為這些圖像很可能已被納入模型的訓練資料。若模型之前已見過該圖像及其相關元資料,它並非在「猜測」——而是直接回憶。
- 推理成本:複雜提示僅將思考時間延長約一秒,暗示模型可能立即辨識出圖像,無需依賴詳細的協議。
能力的退化
或許最引人注目的是,地理定位能力似乎是模型特有的,而非普遍提升的趨勢。當以相同基準測試較新模型(gpt-5.4 與 gpt-5.5)時,結果顯示其表現相較於 o3 有顯著下降。
| 執行 | 中位數 km | 平均 km | ≤25 km | ≤100 km | ≤500 km |
|---|---|---|---|---|---|
| o3 預設 | 83.2 | 440.7 | 58 | 109 | 176 |
| o3 GeoGuessr | 102.3 | 481.9 | 59 | 99 | 172 |
| gpt-5.4 預設 | 163.3 | 638.9 | 26 | 74 | 148 |
| gpt-5.5 預設 | 156.5 | 645.9 | 39 | 77 | 161 |
這暗示使 o3 在地理定位上表現卓越的架構或訓練特性,未被後續版本保留。使用者也指出,o3 能以 Python 操作與放大照片以進行辨識的能力是其獨特優勢,而較新模型則缺乏此功能。
結論:嚴謹的重要性
「GeoGuessr 提示」的傳奇是 AI 社群的一個警示故事。在充斥大膽聲稱與病毒式推文的時代,報導「突破」往往比呈現細緻的現實更具誘因。從「感覺」走向基準測試是了解 AI 真正能做什麼——更重要的是,了解它不能做什麼的關鍵步驟。