OpenAI 人間のフィードバックを使った書籍の要約 (2021)
アプローチ: 人間のフィードバックからの強化学習と再帰的タスク分解
OpenAIの手法は、人間のフィードバックからの強化学習を使用して、まず小さなセクションを要約し、その後それらの要約を再帰的に要約して上位レベルの要約を作成することで、書籍を要約するモデルを訓練します。投稿では、「私たちのモデルは、まず書籍の小さなセクションを要約し、その後それらの要約をより上位レベルの要約に要約し、これを繰り返します。」と述べています。
動機: アライメント問題に対する人間の監督のスケーリング
この研究は、書籍の要約のように人間による評価が難しいタスクに対してスケーラブルな監督技術を開発することで、アライメント問題に取り組んでいます。投稿では、「将来、強力で汎用的人工知能を安全に導入するためには、機械学習モデルが人間の意図に従って動作することを確保する必要があります。この課題は alignment problem として知られるようになりました。」と説明しています。
方法論: RLHFと再帰的分解の組み合わせ
このアプローチは、人間のフィードバックからの強化学習を統合し、モデルの出力を人間の好みに合わせ、書籍のセクション全体に階層的に適用します。投稿では、この技術を使用して全書籍を要約するモデルを訓練したと述べています。
例: 古典的な書籍でのデモンストレーション
投稿では、『不思議の国のアリス』、『傲慢と偏見』、『ロミオとジュリエット』、『十二年の奴隷生活』、『私の人生の物語』などの書籍のサンプル要約を示しており、参照用に『不思議の国のアリス』の原文も提供されています。書籍の表紙の画像とカルーセルナビゲーションにより、読者は要約を閲覧できます。
含意: スケーラブルなAIアライメントへ
長いテキストの効果的な要約を示すことで、この手法は他の複雑で評価が難しいタスクにおけるAIシステムのアライメントへの道筋を示しています。投稿では、このようなスケーラブルな監督技術が、将来の汎用AIシステムのアライメントを改善できると示唆しています。