人工知能の害を理解し、対処するためのアントロピックフレームワーク
アントロピックは、児童の安全や誤情報から、大規模な生物学的脅威に至るまで、幅広いAI関連の害を特定・評価・軽減するための構造化されたフレームワークを導入しました。このアプローチにより、研究室はリスクを適切に管理し、AIシステムの有用性や機能性を不必要に妨げないよう安全対策を講じることができます。
害の評価のための多次元フレームワーク
アントロピックは、リスクの包括的な理解を確保するため、5つの基本的な次元にわたってAIの潜在的影響を評価しています。この構造化されたアプローチにより、チーム間での明確なコミュニケーションが可能となり、既知の害および新たな害に対して的確な解決策を策定できます。
影響の5つの次元は以下の通りです:
- 身体的影響: 身体的健康および福祉への影響。
- 心理的影響: 精神的健康および認知機能への影響。
- 経済的影響: 金銭的結果および財産に関する考慮事項。
- 社会的影響: 社会集団、制度、共有システムへの影響。
- 個人の自律性への影響: 個人の意思決定および自由への影響。
これらの影響の現実世界における重要性を判断するため、アントロピックは、発生可能性、規模、影響を受ける人口、持続期間、因果関係、技術の貢献度、および緩和の可能性といった要因に基づいて、各次元を評価しています。
セーフティポリシーおよび執行との統合
この害の評価フレームワークは、特に大規模なリスクに焦点を当てた「責任あるスケーリングポリシー(RSP)」を補完しています。RSPは極端なシナリオを管理する一方で、より広範な潜在的影響に対処するため、以下の統合されたポリシーと実践を通じて、この包括的なフレームワークが活用されています:
- 利用ポリシー: 望ましい利用のための包括的なルールの維持。
- 評価: モデルのリリース前後において、レッドチーム作戦および敵対的テストの実施。
- 検出: 悪用や乱用を特定するための高度な技術の活用。
- 執行: プロンプトの修正からアカウントのブロッキングに至るまで、さまざまな措置の適用。
モデルの能力および行動への応用
アントロピックは、新しい機能の開発やモデルの応答の最適化において、モデルの有用性とセーフティ制限のトレードオフを評価するために、このフレームワークを適用しています。
コンピュータ利用能力
モデルがコンピュータインターフェースと対話できる能力を開発する際、アントロピックは関連するソフトウェアおよび文脈を分析し、必要なセーフティ対策を特定します。特に、詐欺や操作を防ぐための金融ソフトウェアおよび銀行プラットフォーム、およびフィッシングや標的型影響操作を防ぐための通信ツールに注目しています。有用性と安全性のバランスを取るために、アントロピックは階層的要約といった革新的な執行手法を採用しており、プライバシー基準を維持しつつ害の検出を可能にしています。
モデル応答の境界
アントロピックは、このフレームワークを用いて、「無害性に過剰に重きを置く」(不必要な拒否を引き起こす)ことと、「あまりにも役立とうとしすぎること」(有害な行動を引き起こす可能性がある)との間の緊張を管理しています。
Claude 3.7 Sonnetの開発において、このアプローチは、有用性と安全性のスケールに沿ったリクエストを評価するために使用されました。曖昧なプロンプトの扱いを改善することで、不必要な拒否を45%削減しつつ、有害なコンテンツに対する強固なセーフティ対策を維持しました。この洗練されたアプローチは、児童、マイノリティコミュニティ、危機に瀕した個人など、脆弱な集団を保護する上で特に重要です。
今後の展望と協働
アントロピックは、このフレームワークをその全体的なセーフティ戦略の進化する要素と捉えています。研究室は、AIの能力が進化するにつれて、新たな予期せぬ課題が出現する可能性があることを認識しており、評価手法やフレームワークの継続的な適応が求められます。アントロピックは、研究者、政策専門家、業界パートナーの皆様と、usersafety@anthropic.comを通じてこの問題について協働することを呼びかけています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch