AIの安全性には社会科学者が必要

OpenAIは、長期的なAI安全研究において社会科学を取り入れ、実際の人間との相互作用において整合アルゴリズムが成功するようにする必要があると主張する論文を発表した。なぜなら、高度なAIシステムを人間の価値観と整合させるには、人間の理性、感情、バイアスの心理学をナビゲートする必要があり、OpenAIは機械学習研究者と協力する社会科学者を積極的に募集しているからだ。

人間の価値観の整合における課題

AIの整合とは、高度なAIシステムが人間が望む行動を確実に実行することを確保することを目的とする。OpenAIの現在のアプローチは、人々に価値観について尋ね、そのデータで機械学習(ML)モデルを訓練し、学習したモデルに従ってシステムを最適化することである。この研究は、Human Preferencesからの学習、議論によるAI安全、反復的増幅による複雑な目標の学習などの方法で実装されている。

しかし、人間の入力は以下のような要因によりしばしば信頼できない:

  • 認知バイアス: 人間はさまざまな認知バイアスと反省しても成立しない可能性のある一貫しない倫理的信念を示す。
  • コンテキスト依存性: 質問の言い方によって答えが大きく変わることがある。たとえば、質問に「道徳的に」という言葉を含めると、行為の間違いについての判断が変わることがある。
  • 複雑さ: 人間は複雑なタスク、例えば賭けに直面したときにしばしば一貫しない選択をする。

人間のみの実験によるギャップの埋め合わせ

OpenAIは、人間の価値観の背後にある推論をターゲットにするために増幅や議論などの手法を利用しているが、これらのアルゴリズムが現実的で人間中心の状況での振る舞いは未知である。現在の機械学習では、複雑で価値観が伴う質問についての自然言語による議論の中でのみ顕在化する整合性の問題を明らかにするには弱すぎる可能性がある。

現在のMLの限界を回避するため、OpenAIは人間だけで構成される実験の実施を提案している。これらの実験では、人々がAIエージェントの役割を演じる。たとえば、「議論」による整合アプローチでは(通常は2人のAIディベーターと1人の人間の判事を含む)、研究者は2人の人間ディベーターと1人の人間の判事を使用して、実際にプロセスがどのように機能するかを観察することができる。これらの人間のみの相互作用から得られた教訓は、その後機械学習モデルの開発に転用できる。

AI安全における社会科学の役割

機械学習の専門知識だけでは、以下のような人間中心の実験を設計・実行することは不十分である。これらの研究は、人間の認知と行動に関する既存の知識に基づいた厳密な実験設計を必要とする。

OpenAIは、この学際的な取り組みに不可欠ないくつかの社会科学分野を特定している。それらは以下の通りである:

  • 実験心理学
  • 認知科学
  • 経済学
  • 政治学
  • 社会心理学
  • 神経科学
  • 法学

共同イニシアティブ

この統合への第一歩として、OpenAIの研究者はスタンフォード大学の行動科学高等研究センター(CASBS)と協力してワークショップを組織した。このパートナーシップは、Mariano-Florentino Cuéllar、Margaret Levi、Federica Carugatiなどの専門家との継続的なミーティングを含み、社会科学とAIの整合性の交差点について議論している。

Sources