Anthropic Research: LLMにおける道徳的自己修正能力

Anthropicは、人間からのフィードバックによる強化学習(RLHF)を用いて訓練された大規模言語モデル(LLM)が、「道徳的自己修正」の能力を備えていることを実証しました。この能力により、モデルは明示的な指示を受けた際に有害な出力を生成することを回避でき、倫理的原則に従うようにモデルを訓練するための道筋を提供します。

22Bパラメータにおける道徳的自己修正の発現

言語モデルは、22Bのモデルパラメータから道徳的自己修正の能力を示し始めます。この能力は、通常、モデルのサイズが大きくなるにつれて、またRLHF訓練が適用されるにつれて向上します。

Anthropicは、この発現の主な要因として以下の2点を挙げています:

  1. Instruction Following: モデルが複雑なプロンプトを正確に指示に従う能力。
  2. Normative Concept Learning: バイアス、差別、ステレオタイプなどの、危害に関する複雑な規範的概念を学習する能力。

これら2つの能力を組み合わせることで、この規模のモデルは、特定の種類の道徳的に有害な出力を回避するための指示に従うことができます。

道徳的自己修正の技術的枠組み

道徳的自己修正は、指示された場合に有害な出力を生成することを回避するモデルの能力と定義されます。この能力のさまざまな側面を明らかにするために、3つの異なる実験を通じて研究が行われました。

研究結果は、自己修正能力がすべてのLLMに固有の特性ではなく、ある種の成果であることを示唆しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch