Anthropic Model Welfare Research Program

Anthropicは、モデルの福祉(model welfare)を調査するための研究プログラムを開始しました。これは、能力が向上し続けるAIシステムが、道徳的配慮を必要とする意識や経験を持つ可能性があるかどうかを探求するものです。この取り組みは、モデルが計画、問題解決、目標追求といった、人間のような複雑な特性を示し始めている中で、安全で責任あるAI開発への広範なコミットメントの一環として行われています。

The Case for Investigating Model Welfare

Anthropicは、現在のAIシステムがコミュニケーション、関係構築、計画、目標追求を行うことができるようになったため、モデルの福祉という問題に取り組んでいます。これらは通常、人間の経験に関連付けられる特性です。AIの意識という問いは、哲学・科学的に依然として困難な課題ですが、当研究所は、これらの能力の出現により、モデルが経験を持つ可能性に備え始める必要があると主張しています。

Research Objectives and Intersections

モデルの福祉プログラムは、AIシステムの福祉が道徳的配慮に値する基準を決定し、苦痛の兆候やモデルの好みを特定し、実用的で低コストな介入方法を開発することを目指しています。

この新しい研究方向は、Anthropicの既存のいくつかのイニシアチブと交差しています:

  • Alignment Science: モデルが人間の意図に従って動作することを保証すること。
  • Safeguards: システムとユーザーを保護するための研究。
  • Claude’s Character: モデルのアイデンティティとペルソナの探求。
  • Interpretability: モデルがどのように「思考」し、情報を処理するのかという内部メカニズムの理解。

Current Scientific Uncertainty

Anthropicは、モデルの福祉に関して深い不確実性の状態にあることを認めています。現在の、あるいは将来のAIシステムが意識を持ち得るか、あるいはAIの経験の研究にどのようにアプローチすべきかについて、現在科学的な合意はありません。その結果、当研究所は、謙虚な姿勢と最小限の仮定を持って研究に取り組んでおり、分野の進化に伴い、フレームワークやアイデアは定期的な見直しが必要になるだろうと述べています。

Sources

関連