議論によるAI安全性
OpenAIは、エージェント同士がトピックについて議論し、人間の審判が勝者を決定する新しいAI安全技術を提案しました。このアプローチは、直接人間が評価するには複雑すぎる認知的に高度なタスクを実行するAIシステムを人間が監督できるようにすることを目的としています。
AIアラインメントのための議論フレームワーク
AIアラインメントはしばしば、トレーニング中に人間が安全で有用な行動を特定することに依存します。しかし、エージェントの行動が人間にとって理解しきれないほど複雑である場合や、タスクが判断するには難しすぎる場合、この方法は失敗します。これを解決するために、OpenAIは学習問題を、立場を議論する二つのエージェントが対戦し、人間が審判を務めるゲームとして再構成することを提案しています。
核心となる前提は、AIエージェントが人間の審判よりも問題を高度に理解していても、人間はどちらのエージェントがより優れた議論を提示しているかを判断できるということです。エージェントはAlphaGo Zeroで用いられた手法と同様に自己対戦(セルフプレイ)で訓練されます。目的は、議論を徐々にシンプルな事実争点に絞り込み、最終的に人間が正しく判断できるほど単純な主張に至らせることです。
概念実証:スパースMNIST分類器
概念を制御された環境でテストするため、OpenAIはMNISTデータセットを用いた実験を行いました。この設定では、"審判"はランダムに選ばれた6つの非黒ピクセルだけから数字を予測するように訓練された分類器です。二人の議論者は画像全体を完全に把握していますが、審判はほとんどの情報に対して「盲目」状態です。
MNIST実験の主な結果は以下の通りです:
- 精度向上:議論者が事前に自分の立場を宣言しなければならない場合、スパース分類器の精度は 59.4% から 88.9% に上昇します。
- 正直なプレイ vs. 悪意あるプレイ:一方のエージェントは審判が正しく推測できるよう正直に行動し、もう一方は審判を騙そうとします。正直なプレイヤーは 88.9% の確率で勝利します。
- エラーパターン:議論における成功した嘘は数字の8と9に集中しており、ある数字は他の数字よりも誤表現しやすいことを示唆しています。
人間中心のテスト:猫対犬の議論
OpenAIは、人間の参加者が議論者と審判として機能する議論メカニズムをテストするためのプロトタイプウェブサイトを開発しました。これらの「猫対犬」議論では、議論者は自然言語で自らの立場を主張できますが、争点を解決するために画像から必ず真実であるピクセルを1つだけ明らかにすることに制限されています。
OpenAIでの非公式テストでは、議論が進むにつれて嘘を維持することが難しくなり、エージェントが特定の争点に焦点を当てるため、正直なエージェントが通常勝利することが示されました。研究者は、審判が情報を要求する速度を制限することで、嘘をつく側にとってゲームが公平になることに言及しています。詳細な嘘を構築するには認知的負荷が高いためです。
制限事項と今後の方向性
議論モデルは複雑な目標のためのトレーニングシグナルを生成する手法を提供しますが、いくつかの根本的な制限があります:
- ロバスト性:議論は敵対的例や分布シフトに対処せず、トレーニングシグナルを提供する手法であり、ロバスト性の保証ではありません。
- 理論的保証:自己対戦が常に最適なプレイや正しい主張に到達するという理論的保証はありません。
- 計算コスト:議論を行うように訓練されたエージェントは、直接回答を提供するエージェントに比べてより多くの計算資源を必要とします。
- 人間審判の限界:人間の審判は偏りすぎているか、議論が単純な事実に絞られた後でも正しい判断を下す認知能力が不足している可能性があります。
今後の研究では、より難易度の高い視覚実験、自然言語による議論、そして人間のバイアスが結果に影響を与える可能性のある価値観に関わる質問にシステムがどのように対処するかのテストに焦点を当てます。
Sources
- OriginalAI safety via debate