Anthropic 言語モデルのレッドチーミング報告書 – 手法、スケーリング挙動、および得られた教訓

TL;DR

Anthropic の新しい報告書によると、RLHF でトレーニングされた言語モデルは、パラメータ数が 2.7B から 52B に増加するにつれて、レッドチーム攻撃に対する耐性がますます高まることが判明しました。一方で、プレーンなモデル、ヘルプフルなプロンプトを用いたモデル、およびリジェクションサンプリングを用いたモデルは、明確なスケーリングの傾向を示しませんでした。また、チームはコミュニティの安全性向上に向けた取り組みを加速させるため、38,961 件の攻撃データセットと完全な手法ガイドを公開しています。

スケーリング挙動に関する主な知見

RLHF モデルはスケールに応じてレッドチーミングが困難になる。 2.7B、13B、および 52B パラメータの 3 つのサイズにおいて、Anthropic は、人間のフィードバックによる強化学習(RLHF)でトレーニングされたモデルに対する、有害なプロンプトの成功数が単調に減少することを観察しました。これは、モデルの容量が拡大するにつれて、RLHF が敵対的な探索に対する堅牢性を高めることを示唆しています。

他のモデルタイプは平坦なスケーリング傾向を示す。 プレーンな言語モデル、「helpful, honest, and harmless」となるようプロンプトされたモデル、およびリジェクションサンプリングを使用するモデルは、同じサイズ範囲において、レッドチーミングのしやすさに系統的な変化を示しませんでした。有害な出力に対する感受性は、パラメータ数に関わらずほぼ一定でした。

データセットの公開

38,961 件のレッドチーム攻撃が公開されました。 Anthropic は、研究中に収集された敵対的なプロンプトの全セットと、それに対応するモデルの出力を公開します。このデータセットには、露骨な攻撃的言語から、微妙で非暴力的な非倫理的コンテンツに至るまで、有害な挙動のスペクトラムが含まれており、将来の安全性研究のための貴重なベンチマークとなります。

手法の手法概要

指示とプロセスの透明性。 報告書は、レッドチームの指示、参加者の募集、プロンプト生成のワークフロー、および統計的分析手法を網羅的に記録しています。また、アノテーター間の不一致や自動検出の限界など、不確実性の要因についても議論しています。

統計的な厳密さ。 Anthropic は、モデルファミリーとスケール間で攻撃の成功率を比較するために、信頼区間と仮説検定を採用しており、観察された傾向がサンプル分散によるアーティファクトではないことを保証しています。

AI 安全性コミュニティへの影響

RLHF がスケールに応じて安全性を向上させることができるという証拠。 RLHF モデルの攻撃成功率の低下は、人間のフィードバックを通じてモデルを調整(align)することが、スケーラブルな安全性の利点をもたらすという仮説を支持しています。

共通の標準の必要性。 データセットと詳細な手法のプレイブックの両方を公開することで、Anthropic は、コミュニティの規範、再現可能なレッドチーミングの実践、およびモデルの有害性を評価するための技術的標準の開発を促進しています。

リソース

Sources

関連