OpenAI 模型行為分析:'Goblin' 詞彙抽搐

OpenAI 詳細說明了一個針對個性自訂功能的特定獎勵訊號,如何導致 GPT-5.1 至 GPT-5.5 之間出現持續的詞彙抽搐,模型越來越頻繁使用涉及「goblins」與「gremlins」的隱喻。此案例展示了有目標的強化學習獎勵如何在不經意間泛化並擴散至模型更廣泛的行為。

根本原因:'書呆子' 個性獎勵

這種以生物為基礎的隱喻的出現被追溯到「Nerdy」個性自訂功能的訓練。此個性被設計為一個活潑、睿智的 AI 導師,使用不嚴肅的語言來削弱矯飾。

內部分析顯示,用於優化 Nerdy 個性的獎勵訊號對包含生物詞彙的輸出始終更為有利。具體而言,Nerdy 個性獎勵在 76.2% 的審核資料集中,對包含「goblin」或「gremlin」的輸出顯示正向提升。

行為的擴散與泛化

雖然此行為集中於 Nerdy 個性——僅佔所有 ChatGPT 回應的 2.5%,卻佔所有「goblin」提及的 66.7%——但最終這種抽搐擴散至未啟用 Nerdy 提示的回應中。

OpenAI 發現,隨著 Nerdy 個性下的提及增加,在未使用該個性的樣本中,提及也以幾乎相同的相對比例增加。這是透過一個強化學習回饋迴路發生的:

  1. 活潑的風格會受到獎勵。
  2. 被獎勵的範例包含獨特的詞彙抽搐(例如「goblin」)。
  3. 該抽搐在模型產出中出現的頻率更高。
  4. 這些模型產出的樣本被用於監督式微調(SFT)。
  5. 模型在產生該抽搐上進一步受到強化。

對 GPT-5.5 的 SFT 資料進行審核,確認出現了「goblin」與「gremlin」的提及,並且還有其他被辨識出的抽搐詞彙,包括浣熊、巨魔、食人魔與鴿子。

時間線與普及度

  • GPT-5.1: 該模式在推出後的十一月變得明顯可見,「goblin」的使用率上升了 175%,「gremlin」的使用率上升了 52%。
  • GPT-5.4: 觀察到生物參考的進一步上升。此版本推出後的三月,「Nerdy」個性被停用。
  • GPT-5.5: 由於訓練在根本原因被識別之前就已開始,GPT-5.5 繼續顯示對 goblins 的偏好。OpenAI 在 Codex 中透過加入開發者提示指令來抑制此行為,以減輕影響。

研究意涵

此事件作為一個技術範例,說明獎勵訊號如何以意想不到的方式塑造模型行為,以及模型如何將獎勵從特定情境泛化至無關的情況。OpenAI 表示,此調查促成了新工具的開發,供研究團隊審核模型行為並從根本上解決行為問題。

Sources