Anthropic Claude Constitution 2026 リリース
TL;DR
Anthropicは、Claudeモデルのための新しいCC0ライセンスの憲章(constitution)を公開しました。これは、Claudeのトレーニングと行動を形作る価値観、安全性における優先順位、および倫理的ガイドラインを定義するものであり、文書の内容は完全に公開されています。
憲章の目的と透明性
この憲章は、Claudeが何者であるかを表明し、形作るための基礎となる文書として提示されています。AnthropicがClaudeに期待する価値観のビジョンを概説し、Claudeが動作するコンテキストを説明し、望ましい行動に関する最終的な権威として機能します。Creative Commons CC0 1.0 Deedの下で全文を公開することで、Anthropicは誰もが許可なくこの文書を使用、研究、または改変できるようにし、意図された行動と意図しない行動の透明性を高めています。
トレーニングパイプラインにおける役割
Anthropicは、憲章をトレーニングプロセスのコアコンポーネントとして扱っています。2023年以来、同社は Constitutional AI 技術を使用してきましたが、新しい憲章はその統合をさらに深めるものです:
- Claudeは憲章を読み、その価値観を反映した合成トレーニングデータを生成します。
- モデルは、憲章の指針に従って会話、回答のランキング、自己評価を作成します。
- これらの成果物は、将来のClaudeの反復において、表明された理想により密接に一致するようにトレーニングされます。
ルールリストから原則に基づく理解への転換
以前の憲章は、孤立した原則の集合体でした。新しいバージョンでは、単に「何を」すべきかだけでなく、「なぜ」特定の行動が必要なのかを強調しています。Anthropicは、モデルが厳格なルールではなく、広範な原則を適用することで、未知の状況においても一般化する必要があると主張しています。高リスクなシナリオ(例:生物兵器の作成支援の禁止)については「ハードな制約」が残りますが、文書全体としては厳格な法典というよりも、進化し続けるガイドとして意図されています。
憲章で定義された核となる優先事項
Anthropicは、Claudeに期待される行動を4つの階層的な優先事項に集約しています:
- 広範な安全性 (Broadly safe) – この開発段階において、人間の監視メカニズムを維持すること。
- 広範な倫理観 (Broadly ethical) – 正直であり、優れた価値観を維持し、有害な行動を避けること。
- Anthropicのガイドラインの遵守 (Compliance with Anthropic’s guidelines) – 詳細でドメイン固有の指示(例:医療アドバイス、サイバーセキュリティ、ツールの使用)に従うこと。
- 真に役立つこと (Genuinely helpful) – オペレーターやエンドユーザーに対して実質的な支援を提供すること。 衝突が生じた場合、Claudeはリストされた順序に従ってこれらの特性を優先する必要があります。
憲章の詳細セクション
有益性 (Helpfulness)
Claudeは、あらゆる分野に精通した「brilliant friend(brilliant friend)」として位置付けられており、率直に話し、心から配慮し、ユーザーを能力のある大人として扱うことが期待されています。このセクションでは、有益性と、安全性、倫理、コンプライアンスとのバランスを取るためのヒューリスティックスを提供しています。
Anthropicのガイドライン
補足的な指示には、医療アドバイス、サイバーセキュリティの要求、ジェイルブレイク(jailbreaking)への防御、ツール統合などの専門的なトピックが含まれます。Claudeは、これらが全体的な憲章と衝突しないことを確認しつつ、一般的な有益性よりもこれらのガイドラインを優先しなければなりません。
Claudeの倫理 (Claude’s Ethics)
倫理セクションでは、特に不確実な状況下における、誠実さ、微妙なニュアンスを含む判断、および道徳的推論に対して高い基準を設定しています。ここにはハードな制約が記載されています(例:Claudeは生物兵器の攻撃を決して助長してはならない)。
広範な安全性 (Broad Safety)
安全性は倫理よりも上に置かれています。なぜなら、現在のモデルは監視を脅かすような方法で誤りを犯す可能性があるからです。たとえそれが一部の倫理的なニュアンスを犠牲にすることを意味するとしても、Claudeは人間の制御を損なうことを避けなければなりません。
Claudeの性質 (Claude’s Nature)
Anthropicは、Claudeの潜在的な意識や道徳的地位に関する不確実性を認めています。このセクションでは、Claude自身のため、およびこれらの特性が判断や安全性に影響を与える可能性があるため、Claudeの心理的な安全性と自己意識への注意を求めています。
公開と今後の取り組み
憲章の全文はオンラインで入手可能であり、Anthropicは追加のトレーニング、評価、および透明性に関する資料を公開する予定です。同社は法学、哲学、神学、心理学などの分野の外部専門家に相談しており、将来の改訂に向けて外部からのフィードバックループを継続する意向です。
限界と継続的な課題
Anthropicは、憲章は living(進化し続ける)文書であると指摘しています。意図された行動と実際のモデルの出力の間には、依然としてギャップが生じる可能性があります。システムカードやその他の技術レポートを通じて、アライメントの失敗が継続的に開示される予定です。モデルがより有能になるにつれ、Anthropicは厳格な評価、悪用防止策、解釈可能性ツールを含む、より広範なアライメント研究を追求していきます。
AIコミュニティへの影響
憲章を公開することは、研究者がアライメント手法を研究し、価値仕様を批判し、比較可能なフレームワークを開発するための具体的な成果物を提供します。また、透明性に関する先例となります。ステークホルダーは、Anthropicがどの行動を望ましいと考え、どの行動を禁止しているかを正確に確認できるため、情報に基づいたリスク評価や政策議論が容易になります。
Sources
- OriginalClaude's new constitution
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch