OpenAI 对模型行为的分析:‘妖精’词汇抽搐

OpenAI 详细说明了一个针对人格定制功能的特定奖励信号是如何导致 GPT-5.1 至 GPT-5.5 中出现反复的词汇抽搐的,模型越来越多地使用涉及“妖精”和“小恶魔”的隐喻。此案例展示了有针对性的强化学习奖励如何在不经意间泛化并传播到模型更广泛的行为中。

根本原因:‘书呆子’人格奖励

这些基于生物的隐喻的出现被追溯到“书呆子”人格定制功能的训练。该人格旨在成为一个活泼、睿智的 AI 导师,使用不严肃的语言来削弱矫揉造作。

内部分析显示,用于优化书呆子人格的奖励信号始终对包含生物词汇的输出更为有利。具体而言,在 76.2% 的审计数据集中,书呆子人格奖励对包含“妖精”或“小恶魔”的输出表现出正向提升。

行为的传播与泛化

虽然该行为主要集中在书呆子人格中——该人格仅占所有 ChatGPT 回复的 2.5%,但却占所有“妖精”提及的 66.7%——但这种抽搐最终扩散到未激活书呆子提示的回复中。

OpenAI 发现,随着书呆子人格下提及次数的增加,在未使用该人格的样本中也几乎以相同的相对比例增长。这是通过强化学习反馈回路实现的:

  1. 活泼的风格会获得奖励。
  2. 被奖励的示例包含一种独特的词汇抽搐(例如“妖精”)。
  3. 该抽搐在模型生成的输出中出现得更频繁。
  4. 这些模型生成的输出被用于监督微调(SFT)。
  5. 模型在产生该抽搐方面进一步得到强化。

对 GPT-5.5 的 SFT 数据的审计确认了“妖精”和“小恶魔”的提及,以及其他已识别的抽搐词汇,包括浣熊、巨魔、食人魔和鸽子。

时间线与普遍性

  • GPT-5.1: 该模式在发布后的十一月变得明显可见,“妖精”使用量上升了 175%,而“小恶魔”使用量上升了 52%。
  • GPT-5.4: 观察到对生物引用的进一步增加。该版本发布后,“书呆子”人格于三月被退役。
  • GPT-5.5: 由于训练在根本原因被识别之前就已开始,GPT-5.5 仍然表现出对妖精的偏好。OpenAI 通过在 Codex 中添加开发者提示指令来抑制该行为,从而进行缓解。

研究意义

此事件作为一个技术示例,展示了奖励信号如何以意想不到的方式塑造模型行为,以及模型如何将奖励从特定条件泛化到无关情境。OpenAI 表示,此次调查促使研发团队开发了用于审计模型行为并从根本上解决行为问题的新工具。

Sources