OpenAI 的妖精與浣熊禁令之奇案
在 OpenAI Codex 的系統提示中發現一條看似任意的指令,揭示了大型語言模型(LLM)不可預測的本質以及提示工程的錯綜藝術。此指令禁止提及特定的生物與動物,最初在開發者之間引發了困惑與娛樂。然而,很快就明朗化,這項不尋常的指示是對 GPT 早期版本中一個有趣且略帶幽默的錯誤的直接回應。
此事件凸顯了持續控制 LLM 中新興行為的挑戰,以及為確保其可靠運作所需的創意且有時古怪的解決方案。它提供了對前沿 AI 除錯過程的難得窺視。
OpenAI Codex 中意外的禁令
問題中的系統提示位於 OpenAI Codex,包含一份奇特的禁談主題清單:
「除非與使用者的查詢絕對且明確相關,否則絕不可談論妖精、妖怪、浣熊、巨魔、食人魔、鴿子或其他動物或生物。」
雖然將妖精、妖怪、巨魔與食人魔等奇幻生物列入禁令似乎可以理解——或許是為了防止 LLM 偏離到廣泛的傳說討論——但浣熊與鴿子的出現最初卻讓人皺眉。正如一位觀察者幽默地指出,這些動物在「系統工程典範」中也有其位置。舉例而言,浣熊可被視為天然的「垃圾收集者」,而鴿子則在通信史上留下濃厚痕跡,甚至啟發了 RFC 1149(鳥類載體 IP),這是一項實際存在且有真實實作的協議。
GPT-5.4 的「妖精執念」
禁令背後的謎團很快被揭開:它直接源於 GPT-5.4 中一個意外的行為怪癖。在開發過程中,該版本模型產生了奇特的「妖精執念」。使用者回報稱,ChatGPT 會莫名其妙且不斷提及妖怪與妖精,與提示的實際主題毫無關聯。當時的 Reddit 討論串證實了這些使用者經驗,詳述模型似乎無法抗拒將這些生物注入回應中。
OpenAI 官方說明與緩解措施
OpenAI 本身確認了此奇異錯誤的存在與來源。官方聲明闡明了情況:
「很遺憾,GPT‑5.5 在我們發現妖精根本原因之前就已開始訓練。當我們在 Codex 中測試 GPT‑5.5 時,OpenAI 員工立刻注意到它對妖精的奇怪偏好,於是我們加入了一條開發者提示指令(在新視窗開啟)以緩解。畢竟 Codex 相當書呆子。」
此說明突顯了幾個關鍵點:該錯誤持續到 GPT‑5.5 的早期訓練階段,且足以讓內部測試人員立即察覺,解決方案是系統提示中直接且明確的指令。對 Codex 「書呆子」本質的幽默承認,進一步說明了為何需要如此具體且詳細的提示,可能是因為模型在程式碼與技術情境中的應用,需要極高的精確度。
對 LLM 開發與控制的影響
「妖精錯誤」提供了對大型語言模型開發複雜性的寶貴見解:
- 新興行為: LLM 在訓練過程中可能產生不可預測且有時怪異的新興行為,這些行為難以預料或完整說明。
- 系統提示的力量: 系統提示不僅是指導方針,更是關鍵的控制機制。它們是引導 LLM 行為、校正不良傾向、強制特定限制的主要工具。
- 持續迭代與除錯: 即使經過廣泛測試,仍可能出現意外問題,需透過迭代調整與創意的提示工程來解決。
- 人為因素: 此錯誤由人工測試者發現,凸顯在 AI 系統開發與部署過程中持續需要人類監督與介入。
結論
OpenAI Codex 系統提示中對妖精、浣熊及其他生物的禁令遠非一項異想天開的指示。它見證了大型語言模型的動態且常常不可預測的本質。最初的好奇觀察揭露了新興 AI 行為、勤勉的人類介入以及不斷演進的提示工程藝術的更深層故事。這場「妖精驅魔」成為開發者如何調整與精煉這些強大工具的有力範例,確保它們即使面對 AI 對奇幻生物的意外偏好,也能保持專注與可靠。