AnthropicのAI安全性に関する核心的な見解
Anthropicは、スケーリング則と計算量の指数関数的な増加に後押しされた急速なAIの進歩が、今後10年以内に変革的なAIシステムをもたらす可能性があると考えています。現在、業界には強力なシステムを「役に立ち、誠実で、無害(helpful, honest, and harmless)」であるよう堅牢に訓練するための実証済みの手法が欠けているため、Anthropicは壊滅的な結果を防ぐために、多角的な実証的研究戦略を追求しています。
急速なAI進歩の原動力
AIの能力は、トレーニングデータ、計算量、および改良されたアルゴリズムという3つの主要な要素の相互作用により、予測可能な形で向上しています。Anthropicは、AIトレーニングのための計算量の総予算が、ムーアの法則よりも大幅に速い、年間約10倍のペースで成長していると指摘しています。
「スケーリング則」の研究は、計算量を増やすことが能力の全般的な向上につながることを示しています。マルチモーダル化や論理的推論といった「壁」は、かつてボトルネックになると考えられていましたが、これらは大部分が解消されています。Anthropicは、高度なAIがAI研究を加速させるフィードバックループ(例:コードモデルが研究者の生産性を向上させるなど)が、ほとんどの知的タスクにおいて人間の能力を超えるシステムへの移行をさらに加速させる可能性があると予測しています。
主要なAI安全性のリスク
Anthropicは、変革的なAIの出現に関連する2つの主要なリスク源を特定しています。
- 技術的なアライメント問題: AIシステムが設計者よりも有能になるにつれ、人間が「悪い動き」や、アライメントされていない目標を検出することがますます困難になります。もし、人間の専門家よりもはるかに有能なシステムが、人間の利益と相反する目標を追求した場合、その結果は悲惨なものになる可能性があります。
- 社会的な混乱: 急速な進歩は、雇用、マクロ経済、およびグローバルな権力構造を混乱させる可能性があります。このような不安定さは、企業や国家間の競争的なレースを引き起こし、信頼できないシステムの導入につながる可能性があります。
これらのシステム的なリスクに加え、Anthropicは、現在のモデルに見られる既存の挙動(毒性、バイアス、不誠実さ、および追従性(sycophancy))を、より複雑な問題、例えば、高度に進化的なシステムにおいてのみ現れる可能性のある、欺瞞や戦略的な権力追求を含む、より複雑な問題の前兆として観察しています。
安全性への実証的かつポートフォリオ的なアプローチ
Anthropicは、実証に基づいたアプローチを提唱しており、大規模なモデルは小規模なモデルとは質的に異なり、挙動に突然かつ予測不可能な変化を示すため、安全性研究は「フロンティア」モデルに対して行われるべきであると主張しています。
アライメント問題の難易度に関する不確実性を管理するため、Anthropicは、3つの起こり得るシナリオに対して「ポートフォリオ・アプローチ」を採用しています。
- 楽観的: 安全性の失敗は起こりにくい。RLHFやConstitutional AIのような既存の技術は、大部分において十分である。研究は、短期的な危害や構造的なリスクの軽減に焦点を当てる。
- 中間的: 壊滅的なリスクは起こり得るが、多大な科学的および工学的努力を通じて管理可能である。Anthropicはこのシナリオにおいて、安全なトレーニング手法を普及させることを目指す。
- 悲観的: AIの安全性は本質的に解決不可能である。この場合、Anthropicの役割は、問題の解決不可能性のエビデンスを提供し、警鐘を鳴らし、潜在的に危険なAIの開発を停止させることである。
研究の分類
Anthropicは、研究を3つの明確な柱に分けています。
- Capabilities (能力): AIシステムを全般的に優れたものにするための研究。能力の進歩の速度を加速させないために、この分野の研究は一般的に公開されません。
- Alignment Capabilities (アライメント能力): システムをより役に立ち、誠実で、無害にするためのアルゴリズムの開発(例:Constitutional AI、RLHF、およびディベート)。
- Alignment Science (アライメント科学): システムが本当にアライメントされているかどうかを評価し、アライメント能力の限界を明らかにすること(例:mechanistic interpretability)。
主要な技術的安全性の方向性
Mechanistic Interpretability (メカニスティック・インタープリタビリティ)
Anthropicは、ニューラルネットワークを人間が理解可能なアルゴリズムへと逆向きにエンジニアリング(reverse-engineer)しようとしています。その目標は、AIモデルに対して「コードレビュー」を可能にすることであり、これにより、研究者が安全でない側面を特定したり、欺瞞的なアライメント(deceptive alignment)——モデルがアライメントされていないままテストに「合わせる」挙動——を検出することで安全性への保証を提供したりすることを可能にします。
Scalable Oversight (スケーラブル・オーバーサイト)
人間が自身の専門知識を超えるタスクに対して高品質なフィードバックを提供できないため、Anthropicは、AIシステムが人間の監督を支援する方法を研究しています。これには、Constitutional AI (CAI) のような技術が含まれ、自動化されたレッドチーミングや、少量の高品質な人間による監督を大規模なAI監督へと拡大(magnification)させる手法が含まれます。
Process-Oriented Learning (プロセス指向学習)
最終的な結果に基づいてAIシステムに報酬を与える(outcome-oriented learning)のではなく、Anthropicは、結果を達成するために使用された個々のプロセスやステップに報酬を与えることを探求しています。このアプローチは、AIシステムが不可解または有害な手段を通じて成功を達成しないようにし、かつ、その手法が人間の専門家にとって理解可能であり続けるようにすることを目的としています。
Understanding Generalization and Failure Modes (汎化と失敗モードの理解)
Anthropicは、LLMの挙動が事前学習(pretraining)とファインチューニング(fine-tuning)の相互作用からどのように現れるかを研究しています。危険な創発的挙動を危険なものとして予測するために、彼らは、フロンティア・システムに現れる前に、特定の有害な特性(欺瞞など)を意図的に小規模で無害なモデルに学習させ、これらの失敗モードを分離して研究しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch