Anthropic: ターゲットを絞ったAI規制の必要性
Anthropicは、AIの能力が進化するにつれて、壊滅的なリスクを防ぐために、政府は今後18か月以内にターゲットを絞ったAI政策を実施しなければならないと主張しています。同社は、慎重かつ狭い範囲に焦点を当てた規制であれば、科学的および商業的な進歩を妨げることなくこれらのリスクを軽減でき、効果が低く負担の大きい「反射的な」規制の危険を回避できると断言しています。
サイバーおよびCBRN領域におけるリスクの加速
数学、推論、コーディングにおけるAIの能力は急速に進化しており、悪用や自律的な破壊的行動の両方の可能性を高めています。Anthropicは、緊急の懸念事項として主に2つの領域を特定しています。
サイバー能力
ソフトウェアエンジニアリングのタスクにおけるモデルの性能は大幅に向上しています。SWE-benchベンチマークにおいて、能力は1.96%(Claude 2, 2023年10月)から13.5%(Devin, 2024年3月)へ、そして49%(Claude 3.5 Sonnet, 2024年10月)へと成長しました。AnthropicのFrontier Red Teamの報告によると、現在のモデルはすでにサイバー攻撃タスクを支援しており、次世代モデルは、長期にわたる多段階のタスクを計画する能力により、さらに効果的になると予想されています。
CBRNリスク
AIシステムは、生物学および化学における専門家レベルの知識を示しています。UK AI Safety Instituteは、一部のモデルが博士レベルの専門家と同等の科学的回答を提供することを発見しました。これは、GPQAベンチマークの最も困難なセクションにおけるスコアに反映されており、38.8%(2023年11月)から59.4%(Claude 3.5 Sonnet, 2024年6月)へ、そして77.3%(OpenAI o1, 2024年9月)へと上昇し、人間の専門家は81.2%でした。
責任あるスケーリング・ポリシー(RSP)フレームワーク
Anthropicは、壊滅的なリスクを特定し軽減するために、適応型フレームワークとして責任あるスケーリング・ポリシー(RSP)を利用しています。RSPは、2つの核となる原則に基づいています。
- Proportionality(比例性): モデルが定義された「能力のしきい値」に達するにつれて、安全性とセキュリティの対策が強化されます。
- Iteration(反復): 能力は定期的に測定され、安全性へのアプローチは新しい知見に基づいて更新されます。
Anthropicによれば、RSPは組織に主に3つの利点をもたらします。セキュリティと安全性評価への早期投資を強制し、特定の脅威モデルの開発を必要とし、悪用防止策に関する透明性を促進します。
効果的なAI規制のための提案された原則
Anthropicは、RSPが、執行可能な政府規制のプロトタイプとして機能すべきであると提案しています。彼らは、効果的な規制フレームワークには、以下の3つの主要な要素が必要であると提案しています。
- Transparency(透明性): 政府は、企業に対し、AIシステムの各新世代ごとにRSPのようなポリシーとリスク評価を公開することを要求すべきであり、それらの主張の正確性を検証するメカニズムを備えるべきです。
- Incentivizing Safety(安全性のインセンティブ化): 規制は、効果的なRSPの開発を促進すべきです。これは、規制当局が脅威モデルを特定し、標準を指定、またはRSPを比較することで、安全性における「トップへの競争」を促すことで達成できます。
- Simplicity and Focus(簡潔さと焦点): 規制は「外科的」であるべきであり、不必要な負担や、混乱を招いたり壊滅的なリスクの防止という目的を妨げたりするような不合理なルールを避けるべきです。
実装と戦略的検討事項
Anthropicは、これらの規制の導入に関するいくつかの戦略的な質問に対処しています。
管轄権と範囲
米国の連邦法は、統一的な規制と国際的な交渉のための理想的な手段ですが、Anthropicは、連邦プロセスが遅すぎる場合、州の規制が不可欠なバックストップとして機能する可能性があると示唆しています。国際的には、共通の安全およびセキュリティのアプローチが、標準化と相互承認を通じて、ビジネスのグローバルなコストをコストを低減できると主張しています。
モデルベース vs. ユースケースによる規制
Anthropicは、汎用モデルに対する「ユースケースによる規制」に反対しています。Claude.aiやChatGPTのようなモデルは、多種多様なタスクを実行できる汎用製品であるため、基盤となるベースモデルの根本的な特性と安全性対策を規制することが、より実用的です。また、ベースモデルのトレーニングはリソース集約的であるため、規制の最も容易なポイントでもあります。
イノベーションとオープンソースへの影響
Anthropicは、比例的かつ柔軟な規制が、イノベーションを著しく妨げることはないと主張しています。彼らは、安全性の研究はしばしば一般的なAI科学への波及効果をもたらし、堅牢なセキュリティは知的財産(IP)の流出を防ぐと述べています。また、オープンウェイトモデルについては、規制はモデルの重みの共有状態ではなく、経験的に測定されたリスクに基づいて行われるべきであると主張しています。
Sources
- OriginalThe case for targeted regulation
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch