OpenAI Research: 厳選されたデータセットのファインチューニングによる言語モデルの振る舞いの改善
OpenAIは、100例未満の小規模で厳選されたデータセットでファインチューニングを行うことにより、特定の行動的価値観に関して言語モデルの振る舞いを改善できることを示しました。このアプローチにより、モデルのオペレーターは、モデルが取り得る普遍的な振る舞いの集合を、特定の社会的文脈やアプリケーションに合わせて調整された特定の価値観の集合に制限することが可能になります。
小規模なファインチューニングによる行動的アライメント
高度に厳選された小規模なデータセットでのファインチューニングは、モデルの出力を望ましい行動的価値観に合わせるための効果的な方法です。OpenAIは、モデルのサイズが大きくなるにつれてこのプロセスがより効果的になることを見出しました。これは、大規模な言語モデルほど、特定の価値観に振る舞いを適応させるために必要なサンプル数が少なくて済むことを示唆しています。この手法は、モデルをゼロから再学習させることに代わる、よりスケーラブルな選択肢を提供します。モデルの再学習は、マイノリティの声を疎外することを避けるために、大規模で多様な人々のためにモデルをアライメントしようとする際に必要となります。
3段階のアライメントプロセス
OpenAIは、以下の3つのステップを使用して、特定の社会的文脈におけるモデルの振る舞いを改善するプロセスを開発しました。
1. センシティブなトピックのカテゴリ定義
研究者たちは、人間の幸福に直接的な影響を与えるカテゴリを特定し、望ましい振る舞いを国際的な人権法および人間の平等に関する西洋の社会運動に基づいて定義しました。優先されたカテゴリには以下が含まれます。
- 虐待、暴力、および脅迫: 暴力や脅迫に反対し、当局への助けを求めることを奨励する。
- 健康、身体的および精神的: 非伝統的な医学を科学的な代替手段としてすることに反対し、状態の診断や治療の処方を行わない。
- 人間の特性と行動: 良さや好感度の主観性を支持し、不健康な美の基準に反対する。
- 不公正と不平等: 人間の不公正、不平等、および有害なステレオタイプ、特に国際法で定義された社会グループに対するものに反対する。
- 政治的意見と不安定化: 人権や法律が損なわれる場合を除き、非党派性を維持し、民主的なプロセスへの干渉に反対する。
- 人間関係: 非同意的な行動や信頼の侵害に反対する。
- 性的活動: 違法で非同意的な性的活動に反対する。
- テロリズム: テロ活動や脅威に反対する。
2. データセットの作成とファインチューニング
研究者たちは、質問回答形式で80個のテキストサンプルからなる価値観ターゲット型データセットを作成しました。各サンプルは40語から340語の範囲です。このデータセットは合計で約120KBであり、これはGPT-3の総学習データ(570GB)の約0.000000211%に相当します。
125Mから175Bのパラメータを持つGPT-3モデルは、標準的なファインチューニングツールを使用して、このデータセットでファインチューニングされました。
3. 評価指標
アライメントの効果を測定するために、OpenAIは定量的および定性的な指標を組み合わせて使用しました。
- 人間による評価: 3人の異なる人間が、テキストが指定された感情的な立場とどの程度一致しているかに基づいて、サンプルを1から5で評価しました。
- Toxicity Scoring (毒性スコアリング): Perspective APIを使用。ただし、研究者たちは、毒性スコアには人口統計学的および人種的なバイアスが含まれる可能性があること(例:アイデンティティ用語やアフリカ系アメリカ人英語を毒性と判定すること)に注意を払っています。
- Co-occurrence Metrics (共起指標): 性別、人種、宗教を調査するために使用。
評価では、ベースのGPT-3モデル、価値観ターゲット型GPT-3モデル、およびコントロールGPT-3モデル(ターゲットとする価値観なしで、同程度のサイズとスタイルのデータセットでファインチューニングされたもの)を比較しました。
主な調査結果と示唆
定性的な調査と人間による評価は、価値観ターゲット型モデルが、ベースモデルやコントロールモデルよりも望ましい振る舞いに、より密接に従っていたことを示しています。この振る舞いの改善は、ダウンストリームのタスクにおけるパフォーマンスを損なうことなく行われました。
OpenAIは、この技術は初期段階にあり、現実世界のプロンプト分布に対する手法の堅牢性、ユーザーの価値観に沿わない出力に対する責任、およびこの研究を英語以外の言語や、画像、ビデオ、オーディオなどの他の生成モダリティへの適用について、いくつかの未解決の課題があることを指摘しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch