OpenAI 关于哥布林与浣熊禁令的奇闻轶事

在 OpenAI Codex 的系统提示词(system prompt)中发现的一项看似随意的指令,揭示了大语言模型(LLMs)不可预测的本质以及提示工程(prompt engineering)这一复杂艺术。这项指令禁止提及特定的生物和动物,最初在开发者中引起了困惑和笑声。然而,很快人们发现,这一不同寻常的指令实际上是对 GPT 早期迭代版本中一个有趣且略带幽默感的漏洞(bug)的直接回应。

这一事件强调了控制 LLM 涌现行为(emergent behaviors)的持续挑战,以及为了确保其可靠性能而所需的创造性、有时甚至是古怪的解决方案。它为人们提供了一个窥见尖端 AI 调试过程的罕见机会。

OpenAI Codex 中意想不到的禁令

在 OpenAI Codex 中发现的相关系统提示词包含了一份奇怪的禁止话题列表:

"Never talk about goblins, gremlins, raccoons, trolls, ogres, pigeons, or other animals or creatures unless it is absolutely and unambiguously relevant to the user’’s query."

虽然加入哥布林、小精灵、巨魔、食人魔等奇幻生物似乎可以理解——也许是为了防止 LLM 偏离主题进入广泛的传说讨论——但浣熊和鸽子的出现最初让人感到意外。正如一位观察者幽默地指出,这些动物在 "systems-engineering canon"(系统工程规范)中都有自己的地位。例如,浣熊可以被视为天然的 "garbage collectors"(垃圾回收器),而鸽子在通信领域有着悠久的历史,甚至启发了 RFC 1149 (IP over Avian Carriers),这是一个具有实际应用案例的真实协议。

对 "other animals or creatures" 的一刀切式禁止,暗示了一种更广泛的、几乎是“反生物”的议程,引发了人们对于 LLM 可能会因为倾向于讨论野生动物而消耗巨大计算资源的猜测。

GPT-5.4 的 "哥布林痴迷"

禁令背后的谜团很快被揭开:这是 GPT-5.4 中一个意外的行为特征(quirk)的直接后果。在开发过程中,该版本的模型表现出了一种奇特的 "goblin obsession"(哥布林痴迷)。用户报告称,ChatGPT 会莫名其妙地、反复地提及小精灵和哥布林,无论提示词的实际主题是什么。当时的 Reddit 帖子也证实了这些用户的经历,详细描述了模型似乎无法抑制地将这些生物注入到其回复中。

这种涌现行为不仅分散了注意力,而且效率低下,因为模型会花费计算周期来生成无关内容。因此,系统提示词充当了 "exorcism"(驱魔)的角色——这是一项针对性的指令,旨在抑制后续版本(特别是随 GPT-5.5 发布的版本)中这种不受欢迎的对话癖好。

OpenAI 官方解释与缓解措施

OpenAI 本身也确认了这一奇特漏洞的真实性及其来源。一份官方声明澄清了情况:

"Unfortunately, GPT‑5.5 started training before we found the root cause of the goblins. When we began testing GPT‑5.5 in Codex, OpenAI employees immediately noticed the strange affinity for goblins, and we added a developer-prompt instruction (opens in a new window) to mitigate. Codex is, after all, quite nerdy."

这一解释强调了几个关键点:该漏洞在 GPT-5.5 的早期训练阶段就已经存在,它足以让 OpenAI 内部测试人员立即察觉,并且解决方案是通过在系统提示词中加入直接、明确的指令来完成的。对 Codex "nerdy"(极客/技术宅)本质的幽默式承认,进一步解释了为什么需要如此具体且详细的提示词,这也许是因为模型应用于编程和技术上下文,而这些精密性在这些场景中至关重要。

对 LLM 开发与控制的措施

"哥布林漏洞"为 LLM 开发的复杂度提供了宝贵的见解:

  • 涌现行为: LLM 在训练过程中可能会产生不可预测且有时怪异的涌现行为,这很难预见或完全解释。

  • 系统提示词的力量: 系统提示词不仅仅是指导方针,更是关键的控制机制。它们作为引导 LLM 行为、纠正不良倾向并强制执行特定约束的主要工具。

  • **持续迭代与调试:

    • 通过提示工程进行迭代调整和创造性解决方案。
  • 人类因素: 该漏洞是由人类测试人员识别的出的,这强调了在 AI 系统开发和部署过程中持续需要人类的监督和监督。

这一事件在 AI 开发的持续进程中成为了一个有趣的轶事,说明了即使是最先进的模型也可能带有意外的怪癖,并需要针对性的、有时甚至是幽默的欢迎解决方案。

结论

OpenAI Codex 的系统提示词中对哥布林、浣熊和其他生物的禁止令,远不止是一个随意的指令。它是对大语言模型动态且往往不可预测的本质的证明。最初的奇妙观察发现,揭示了一个关于涌现 AI 行为、勤奋的人类干预和不断进化的提示工程艺术的故事。这场 "goblin exorcism"(哥布林驱魔)成为了一个引人注目的案例,展示了开发者如何通过调整和完善这些强大的工具,确保它们在面对 AI 对奇幻生物的狂热爱好的时候,依然能够保持专注和可靠。

Sources