人間フィードバックを使った要約の学習
OpenAIは、テキスト要約のための言語モデルを訓練するために人間フィードバックからの強化学習(RLHF)を適用し、このアプローチが標準的な教師あり学習よりも要約の品質を大幅に向上させることを発見しました。研究者たちは、人間フィードバックで訓練された13億パラメータのモデルが、教師あり学習のみで訓練された120億パラメータのモデルを上回ることを実証しました。
RLHFは要約においてモデルスケーリングを上回る
人間フィードバックからの強化学習は、単にモデルサイズを増やすか教師ありファインチューニングに頼るよりも、高品質な要約へのより効果的な道筋を提供します。比較評価において、1.3Bおよび6.7Bの人間フィードバックモデルによる要約は、Redditデータセットの元の人間が書いた「TL;DR」要約よりも人間ラベラーに好まれました。
ラベラーは長い要約を好む傾向があり、これが最大許容長に収束することが示されました-その結果、モデルは許容される最大長に収束する傾向がありました-しかし長さを制御しても、6.7Bモデルの要約への好みはわずかに低下しただけ(70%から65%へ)で、これは品質の向上が主に要約の長さによるものではないことを示しています。
ニュースデータセットへの一般化と転移
Reddit TL;DRデータセットで訓練されたモデルは、追加のファインチューニングなしで他のドメインにも効果的に転移します。CNN/DailyMailニュースデータセットに適用すると-Redditの投稿よりも2倍以上長い記事を含み、異なる文章スタイルを使用する-人間フィードバックモデルは高品質な短い要約を生成しました。
長さを制御した場合、6.7Bの人間フィードバックモデルはCNN/DMデータセットにおける人間が書いた参照要約よりも高い評価を得る要約を生成しました。これは、RLHFプロセスがモデルに要約の一般的な原則を学ばせ、訓練データの特定のスタイルをただ真似するのではないことを示唆しています。
RLHFの技術的アプローチ
訓練プロセスは4つの主要な段階から構成されます:
- 初期モデル訓練:GPTスタイルのトランスフォーマーモデル(1.3Bおよび6.7Bパラメータ)はまず、教師あり学習を通じて人間が書いたTL;DRを予測するようにファインチューニングされます。
- 人間比較データ収集:人間は同じ投稿の2つの異なる要約を比較し、好む方を選択します。メインモデルは約65,000件の比較で訓練されましたが、8,000件でも効果的な結果が得られました。
- 報酬モデル訓練:報酬モデルは人間の好みを予測するように訓練され、(投稿, 要約)のペアを報酬値にマッピングします。
- RLファインチューニング:要約ポリシーは、100万エピソードにわたるProximal Policy Optimization(PPO)を使用して報酬モデルに対して最適化されます。ポリシーが初期の教師ありモデルに近い状態を保つように、KLペナルティが使用されます。
データ品質と報酬最適化
低品質なラベルから平均的な行動を学ぶモデルの問題を避けるため、OpenAIは厳格質管理を実施しました:
**請負するため、OpenAIは厳格なデータ品質管理を実施しました:
請負業者管理:クラウドソーシングではなく、OpenAIは約80人の請負業者を時給で雇い、オンボーディングやチャットおよびビデオ通話を通じた直接のコミュニケーションを含む実践的な関係を確保しました。
合意モニタリング:研究者は、自身の判断とラベラーの判断の間の合意率を密接に監視しました。
最適化の強度:チームは、報酬モデルに対して過度に最適化すると最終的に性能が低下することを発見しました。最高のサンプルは、データセット内の参照要約の99パーセンタイル程度の予測報酬を持っていることがわかりました。
制約と計算要件
性能向上にもかかわらず、研究者はいくつかの重要な制約を特定しました:
- 行動の定義:RLHFは定義された行動に対して最適化しますが、その行動が何をすべきかを決定するわけではありません。複雑なタスクについては、研究者は「良い」行動の定義に影響を受けるグループを含めることを提案しています。
- データセットのバイアス:Reddit TL;DRデータセットには最小限のモデレーションしかないコンテンツが含まれているため、モデルは攻撃的または有害な社会的バイアスを反映した要約を生成する可能性があります。
- 計算コスト:報酬モデルとポリシーのスケーリングはリソース集約的です;6.7Bモデルのファインチューニングには約320 GPU日が必要でした。
- 性能ギャップ:モデルはまだ絶対的な人間レベルのパフォーマンスに到達していません。正確性、カバレッジ、一貫性の7点スケールにおいて、モデルは総合得点が満点となるのは45%の時間で、参照要約は23%でした。
今後の方向性
OpenAIは、人間にとって評価が難しいタスク-例えば、検証のために広範な調査を必要とする質問-に人間フィードバックをスケールすることを目指しています。提案される解決策には、人間が出力をより正確に評価するのを助けるML駆動のツールを開発することが含まれます。さらに、ラボはバイナリ比較以外のフィードバックタイプ-例えば、人間のデモンストレーション、モデル出力への直接編集、好みの詳細な説明-を探求しています。