コミュニケーションを学ぶ:OpenAIの2017年 出現するAI言語に関する研究
概要
OpenAIの2017年の『コミュニケーションを学ぶ』研究は、強化学習エージェントが協調的な目標に対して報酬を得たときに、基盤づけられ、合成的な言語を考案できることを示しています。
トレーニング設定
エージェントは、シンプルなランドマークがある二次元世界に配置され、他のエージェントと通信することで最も効果的に達成できる個別の目標が与えられます。各エージェントは、各タイムステップでグループにメッセージをブロードキャストでき、すべてのエージェントの報酬の合計に等しい報酬を受け取り、これにより協力が促されます。エージェントは、環境アクション(移動または見る)と通信アクション(ワードライクなシンボルをブロードキャスト)の間で選択します。彼らは過去の通信とすべてのエンティティの位置を観察し、観察されたメッセージをプライベートなリカレントニューラルネットワークに保存します。
出現する言語の特性
その結果得られる言語は、基盤づけられかつ合成的です。基盤づけられているとは、各単語がエージェントが環境で直接体験する何かに結びついていることを意味します。たとえば、シンボルをランドマークや他のエージェントと関連付けることです。合成的とは、エージェントが複数の単語を組み合わせてメッセージを作り、特定のアイデアを表現できることを意味します。たとえば、別のエージェントに特定の場所へ移動するように指示することです。
課題の克服
初期の実験では、解釈を妨げる独自の通信パターンが生じました。まず、エージェントはスペースを含む単一の発話を繰り返しがちで、モールス信号のような非合成的な言語を作り出しました。発話ごとに小さなコストを追加し、タスクの迅速な完了を優先することで、簡潔な使用とより大きな語彙を促しました。第二に、大きな語彙を与えられたとき、エージェントは時々文全体を単一の単語に符号化しようとし、これにより語彙の指数関数的な増加が必要になります。これは、頻繁に使用される単語の使用に報酬を与えることで抑制され、コンパクトな語彙を促進しました。第三に、エージェントは当初、「最上部」や「最左部」などの空間用語でランドマークを参照していましたが、これはグローバル座標フレームに依存していました。エゴセントリックなフレームに切り替えることでこれらの方向がなくなり、エージェントはランドマークをその色の特性で参照するようになりました。
非言語的コミュニケーション
同じトレーニングフレームワークは、エージェントがテキストメッセージを交換できない場合にも機能します。そのような状況では、エージェントは指差し、誘導、または視覚に障害のあるチームメイトを目標に向かって押すなどの物理的な行動を即興で行います。これは付属のアニメーションで示されています。
基盤づけられた言語 vs 象徴的言語
世界との直接的なリンクがなく、中国の部屋の思考実験に似ている巨大なテキストコーパスで言語モデルを訓練するアプローチとは異なり、この方法は言語をエージェントの知覚体験に基づかせ、言葉が現実とどのように関係しているかのより深い理解を目指しています。
今後の方向性
チームは、エージェントが利用できるアクションの範囲を広げ、環境の複雑さを増すことにより、基本的な動詞や名詞を超えたより表現豊かな言語を育む予定です。考案された言語が豊かになるにつれて、人間にとってその解釈は難しくなるため、今後のプロジェクトでは、エージェントが英語を話すパートナーと通信することで 出現する言語と英語を結び付け、翻訳を自動化します。この学際的な取り組みは、UC バークレーの研究者との協力を含み、より賢い言語モデルに関心がある人々に OpenAI でのキャリアを検討するよう呼びかけています。
詳細情報
初期の結果は、添付の arXiv プレプリントに記載されています。
Sources
- OriginalLearning to communicate