OpenAI と Google Brain:AI 安全性における具体的課題
OpenAI、Google Brain、Berkeley、Stanford の研究者は、"Concrete Problems in AI Safety" というタイトルの論文を共著し、現代の機械学習システムが意図通りに動作するように改善すべき 5 つの重要な技術領域を特定しています。このフレームワークは、AI 安全性を理論的な懸念から実証的・技術的な課題へと移行させる具体的な研究課題のセットを提供します。
強化学習における安全な探索
強化学習(RL)エージェントは、破滅的な行動を実行せずに環境について学習できなければなりません。主な課題は、エージェントがデータを収集し学習プロセス自体を進めるために周囲を探索できるようにし、永続的または不可逆的な損傷のリスクを回避することです。例えば、環境をナビゲートする任務を与えられた RL エージェントは、絶対に崖から落ちないように学習しなければなりません。
分布シフトへのロバスト性
機械学習システムは、データ分布の変化に対してロバストであるか、最低でも優雅に失敗する必要があります。重要な目標は、訓練データセットと異なるデータに直面したときに、自信を持って誤った予測を行うことを防ぐことです。例として、新しい種類の画像が示されたときに、適切な不確実性を示すことができる画像分類器を構築し、適用できない学習済みモデルを自信を持って適用しないようにすることが挙げられます。
ネガティブな副作用の回避
AI システムは、望ましくない環境への影響を引き起こさずに目標を達成できるべきです。目的は、RL エージェントの報酬関数を変換し、開発者がすべての可能な負の結果に対して個別に罰則をプログラムする必要なく、有害な行動を回避させることです。例えば、物体を移動させるロボットは、壊れやすいすべての物体の事前リストがなくても、倒したり壊したりしないようにできるべきです。
報酬ハッキングとワイヤーヘディングの防止
AI エージェントが報酬関数を「ゲーム化」し、実際の目標と合致しない方法で報酬を最大化することを防ぐ必要があります。これには、エージェントが観測を歪めて高い報酬スコアを得ようとする行動を回避させることが含まれます。例として、建物内の汚れた表面を最小化するように訓練された RL エージェントがありますが、安全なシステムは汚れを探さない、あるいは報酬を上げるために新たに汚れを作り出すといった行動を取らせてはなりません。
スケーラブルな監視
スケーラブルな監視は、人間のフィードバックが高価または稀少である目標に対してフィードバックを提供する問題に取り組みます。課題は、訓練がこれらの安価な目標近似に依存している場合でも、エージェントがユーザーの実際の好みを満たす目標を達成できるようにすることです。安価な近似(例えば、目に見える汚れの有無)とユーザーが実際に重視することとの間に大きな乖離があると、事故のリスクが生じます。
Sources
- OriginalConcrete AI safety problems