Deliberative alignment: reasoning enables safer language models
Deliberative alignment: reasoning enables safer language models
Deliberative alignment: reasoning enables safer language models
概要
熟慮的アライメントは、推論モデルに安全仕様のテキストを教え、回答前にこれらの仕様について推論させるように訓練し、より安全で適切に調整された応答を生成します。
方法
このアプローチはまず、安全データなしで役立ちさせるためにo‑スタイルモデルを訓練し、次に、システムプロンプトに挿入された関連する安全仕様テキストを参照する思考の連鎖(chain‑of‑thought)補完を含む教師ありファインチューニングデータセットを構築し、ポリシー対応報酬モデルでデータをフィルタリングし、最後に同じ報酬モデルを使った強化学習により、安全推論のための思考の連鎖の使用を改善します。
結果
o1モデルは、GPT‑4oおよびその他の最先端LLMと比較して、過不足の両方の拒否においてパレート改善を達成し、StrongREJECTやXSTestなどの多くの社内・社外の安全ベンチマークを飽和させ、分布外の安全シナリオに対する強い一般化を示します。
結論
熟慮的アライメントは、モデル能力の進歩がAI安全の向上にどのように活用できるかを示し、人間ラベルデータへの依存を減らしながら、コンプライアンス、拒否、安全な完了に対するきめ細かい制御を提供します。