OpenAI 反復増幅による複雑な目標学習
OpenAI は、タスクをより単純なサブタスクに分解してトレーニングシグナルを生成することで、複雑で人間のスケールを超える目標の指定を可能にする AI 安全技術として、反復増幅を提案しています。
複雑タスクにおけるトレーニングシグナルの課題
機械学習は、性能を評価し学習を促進するためにトレーニングシグナル(教師あり学習のラベルや強化学習の報酬など)を必要とします。一部のタスクはアルゴリズム的なトレーニングシグナル(例:囲碁のスコアリング)を持つか、人間が評価できるものもありますが、多くの実世界タスクは人間の実行や判断が困難なほど複雑です。例としては、大規模なコンピュータネットワークのセキュリティ管理や、複雑な交通システムの設計が挙げられます。
正確なトレーニングシグナルがないと、AI システムはタスクを学習できないだけでなく、誤った報酬関数に起因して意図しない危険な行動を生み出す可能性があります。
反復増幅の仕組み
反復増幅は、次の二つの主要な前提に基づいて複雑タスクのトレーニングシグナルを生成します。第一に、人間は大きなタスクの一部を構成する小さな要素を特定できること。第二に、人間はそのタスクの非常に小さなインスタンスを実行できることです。
プロセスは以下の反復サイクルに従います:
- 初期トレーニング: システムは小さなサブタスクをサンプリングし、これらの小規模問題を解決できる人間のデモンストレーションを用いてトレーニングされます。
- タスク拡張: システムはやや大きなタスクをサンプリングします。人間はそれらを、前ステップでトレーニングされた AI がすでに解決できる小さな部分に分解することで支援します。
- 直接学習: 人間支援による分解で得られたこれらの難しいタスクの解決策をトレーニングシグナルとして使用し、AI が人間の介入なしに第二段階のタスクを直接解決できるようにトレーニングします。
- 反復: このプロセスを繰り返し、ますます複合的なタスクに対するトレーニングシグナルを段階的に構築します。
成功すれば、初期の直接的なトレーニングシグナルがなくても、極めて複合的なタスクを解決できる完全に自動化されたシステムが実現します。
おもちゃ領域での実験結果
人間のスケールを超えるタスクや実際の人間シグナルを扱うことはプロトタイプにとって複雑であるため、OpenAI は教師あり学習を用いて 5 つのおもちゃ的アルゴリズム領域で反復増幅をテストしました。これらの実験では、研究者は直接的なアルゴリズム解を知らないふりをし、人間が解のサブピースを組み合わせられるが直接的なトレーニングシグナルを提供できないシナリオをシミュレートしました。
テストされた 5 つのタスクは:
- パーミュテーション累乗
- 順次割り当て
- ワイルドカード検索
- 最短経路
- Union Find
5 つすべてのケースで、反復増幅は直接的な教師あり学習と競合できる性能を示し、増幅プロセスがラベルに直接アクセスできないにもかかわらず、真のラベルにアクセスできるシステムと同等の性能を達成しました。
他の AI 安全手法との関係
反復増幅は他の OpenAI 安全研究と概念的な目標を共有しますが、実装は異なります:
- AI Safety via Debate: 両者とも反復的プロセスと間接的な監督を通じて人間の能力を超えるタスクの訓練を目指しますが、具体的なアプローチは異なります。
- Human Feedback: 反復増幅は報酬予測システムを実装しており、将来的には直接的な人間フィードバックを組み込むことが期待されています。
- Expert Iteration: AlphaGo Zero で使用された手法に似ていますが、エキスパートイテレーションは既存のトレーニングシグナルを強化するのに対し、反復増幅はトレーニングシグナルをゼロから構築します。