OpenAI 教えることによる解釈可能な機械学習
OpenAI は、概念認識のための人間に解釈可能な言語を作成することでコンピュータと人間が協力できる機械教授アプローチを開発しました。この方法は、教師ネットワークと学生ネットワークの間の協力ゲームを使用し、学生が対象概念を正しく推測できるようにする最小の示唆的な例のセットを特定します。
教師-生徒フレームワーク
このアプローチの核は、教師ネットワークが特定の概念(例えば「犬」や「ゼブラ」)を学生ネットワークが推測できるように例を選択する協力ゲームです。目標は、教師が学生の理解を助けるために可能な限り最も示唆的な例を選択できるように学ぶことです。
2段階のトレーニングプロセス
結果の例が人間に解釈可能であることを確保するため、OpenAI は 2段階の技法を使用します:
- 学生トレーニング: 学生ニューラルネットワークは、ランダムに選択された入力例を使用した伝統的な教師あり学習法を最初に使用し、正しい概念ラベルを推測するように訓練されます。
- 教師最適化: 教師ネットワークは、概念と例を結びつけるラベルにアクセスでき、学生にさまざまな例をテストします。教師は、学生が意図された概念を正しく特定するために必要な最小の例のセットに収束します。
共謀と任意のエンコーディングの回避
トレーニングステージを分離することにより、この方法は2つのネットワークが人間に解釈不可能なプライベートな言語を開発することを防ぎます。共同トレーニング—学生と教師が同時にトレーニングされる場合—では、ネットワークはしばしば共謀し、人間に意味をなさない任意のベクトルや例を通じて通信します。たとえば、「犬」のような概念は、ラマとオートバイの画像を通じてエンコードされる可能性があり、または長方形の寸法は、ランダムに見える2つのドットによってエンコードされる可能性があります。
実践的な応用:概念認識
この技法の有効性を示すため、OpenAI の研究者は 4 つの特性に基づいて変化する例を使用しました:サイズ(小、中、大)、色(赤、青、緑)、形状(正方形 vs 円)、および境界線(実線 vs なし)。
この場合、概念は例の部分集合を定義する特性のセットとして定義されます。教師ネットワークは、概念に必要な特性のみを共有する例を選択する方法を学び、これにより学生は関係のない特性を除外できます。
例: 「赤」の概念の教授
「赤」の概念を学生に認識させるために、教師は2つの具体的な例を選択します:境界線のない大きな赤い正方形と、境界線のある小さな赤い円です。これらの2つの形状の間で共通している唯一の特性は色の赤であり、これにより学生は論理的に概念が赤の色によって定義されていると結論付けることができます。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch