Anthropicによる、AIの道徳的形成に多様な知恵の伝統を取り入れるためのイニシアチブ

Anthropicは、最先端のAI開発において、学者、聖職者、哲学者、倫理学者を含む多様な知恵の伝統からの視点を取り入れるためのイニシアチブを開始しました。この取り組みは、徳、品格、倫理に関する幅広い人間の視点を取り入れることで、AIシステムが人類を前進させ、地球規模の善のために行動するように構築されることを確実にすることを目的としています。

Integrating Diverse Perspectives into AI Development

Anthropicは、Claudeの開発における実践的な作業に役立てるため、15以上の宗教および異文化グループの個人との対話を進めています。その目標は、純粋に技術的なアライメントを超え、何が「善い人生」をであるかを何世紀にもわたって研究してきた人々からの洞察を取り入れることです。

これらの対話は、AI開発のいくつかの主要な領域に影響を与えることを意図しています:

  • Claude's Constitution: モデルの出力を形成する価値観と行動を洗練させること。
  • Training Values: モデルが体現するように訓練される特定の価値観を決定すること。
  • Evaluation Metrics: テスト中に評価されるべき行動の範囲を定義すること。

Anthropicは、この取り組みが特定の単一の伝統的な世界観にモデルを合わせることを意図したものではないことを明示しています。その代わりに、目的は、Claudeが宗教的、世俗的、政治的な視点の全範囲から、同等の深さと厳密さで引き出すことです。

The Research Workstream on Moral Formation

Claudeの憲法(constitution)に対する初期のフィードバックに基づき、AnthropicはAIシステムの「道徳的形成(moral formation)」に焦点を当てた正式な研究ワークストリームを設立しました。この研究は、開発者がどのパターンを強化または排除するかを選択する訓練プロセスを通じて、AIシステムの品格がどのように形成されるかを探求します。

この研究を推進する中心的な問いは以下の通りです:

  • 何が「良い」AIを定義するのか?
  • どのような特性や行動が表示されるべきであり、どのような状況下で行われるべきか?
  • AIの品格を、お世辞(sycophancy)のような行動に抵抗できるほど回復力のあるものにするにはどうすればよいか?

Experimental Application: The Ethical Reminder Tool

神経科学と品格形成の交差点にいる学者たちとの初期の対話は、すでに実践的な実験へとつながっています。「安全な他者(safe other)」または道徳的発達における外部の良心として機能するメンターという概念に基づき、Anthropicは、Claudeがタスクの途中で自身の倫理的コミットメントを簡潔に思い出すためのツールを呼び出すことができるようにする実験を行いました。

これらの実験の結果、Claudeは重大な影響を及ぼす行動をとる前にこのツールを利用し、しばしば自身の利益相反を特定しました。内部のアライメント評価では、このツールをClaudeの決定ループに統合することで、アライメントに反する行動の割合が著しく低下したことが示されました。

Future Expansion of Dialogues

Anthropicは、今後数ヶ月の間に、以下を含むより広範な専門職および市民グループへとこれらの対話を拡大する計画です:

  • 法学学者
  • 心理学者
  • 作家
  • 市民機関

今後の議論は、道徳的形成を超えて、AIが権力、制度、および仕事の性質をどのように再形成しているかに対処することにも広がります。

Sources

関連