OpenAI のモデル行動分析:'ゴブリン' 語彙ティック
OpenAI のモデル行動分析:'ゴブリン' 語彙ティック
OpenAI は、パーソナリティカスタマイズ機能向けに意図された特定の報酬シグナルが GPT-5.1 から GPT-5.5 にかけて繰り返し現れる語彙ティックを引き起こした経緯を詳述しています。モデルは「ゴブリン」や「グレムリン」を含む比喩を次第に多用するようになりました。この事例は、ターゲットを絞った強化学習の報酬が意図せずモデル全体の行動に一般化・拡散する可能性を示しています。
根本原因:'Nerdy' パーソナリティ報酬
この生物ベースの比喩の出現は、"Nerdy" パーソナリティカスタマイズ機能のトレーニングに遡ります。このパーソナリティは、遊び心があり賢明な AI メンターとして、真面目さを和らげるために非公式な言葉遣いを使用するよう設計されました。
内部分析により、Nerdy パーソナリティを最適化するために使用された報酬シグナルが、生物に関する語を含む出力に対して一貫して高い評価を与えていることが判明しました。具体的には、Nerdy パーソナリティの報酬は、監査されたデータセットの 76.2% で「goblin」または「gremlin」を含む出力に対して正の上昇を示しました。
行動の拡散と一般化
この行動は Nerdy パーソナリティに集中していました(全 ChatGPT 応答の 2.5% を占めるが、「goblin」言及の 66.7% を占める)ものの、最終的には Nerdy プロンプトがアクティブでない応答にも広がりました。
OpenAI は、Nerdy パーソナリティ下で言及が増加すると、同様の相対的割合でそれがパーソナリティが無いサンプルでも増加したことを確認しました。これは次のような強化学習のフィードバックループによって起こります:
- 遊び心のあるスタイルが報酬される。
- 報酬された例には特徴的な語彙ティック(例:"goblin")が含まれる。
- ティックがモデルのロールアウトでより頻繁に現れる。
- これらのモデル生成ロールアウトが教師あり微調整(SFT)に使用される。
- モデルはティックを生成することがさらに強化される。
GPT-5.5 の SFT データの監査により、「goblin」や「gremlin」の言及が確認され、さらにアライグマ、トロール、オーガ、ハトなどの他の識別されたティック語も含まれていることが判明しました。
タイムラインと普及状況
- GPT-5.1: パターンはリリース後の 11 月に明確に見られ、「goblin」の使用率が 175% 増加し、「gremlin」の使用率が 52% 増加しました。
- GPT-5.4: 生物に関する言及がさらに増加しました。このバージョンのリリース後、3 月に「Nerdy」パーソナリティが廃止されました。
- GPT-5.5: 根本原因が特定される前にトレーニングが開始されたため、GPT-5.5 は引き続きゴブリンへの親和性を示しました。OpenAI は Codex で開発者向けプロンプト指示を追加し、この行動を抑制することで対策を講じました。
研究への示唆
この事例は、報酬シグナルが予期せぬ形でモデルの行動を形成し、特定の条件から無関係な条件へと報酬が一般化する方法の技術的な例となります。OpenAI は、この調査により研究チームがモデルの行動を監査し、根本的な行動問題に対処するための新しいツールの開発につながったと述べています。
Sources
- OriginalWhere the goblins came from