Anthropic Research: Predictability and Surprise in Large Generative Models

Anthropicの研究によれば、GPT-3、Megatron-Turing NLG、Gopherといった大規模生成モデルは、広範なトレーニング分布における予測可能な損失(loss)と、予測不可能な特定の能力、入力、および出力という、直感に反する組み合わせを示しています。

The Tension Between Scaling Laws and Emergent Capabilities

大規模な事前学習により、開発者はスケーリング則に基づいてモデルの性能(loss)を予測することが可能になります。損失のハイレベルな予測可能性がこれらのモデルの急速な発展を推進している一方で、それが特定の挙動の予測可能性に直結するわけではありません。

モデル開発者は、モデルが全般的にどの程度改善するかを予測することはできますが、どの特定の能力が発現するか、あるいはモデルが特定の入力に対してどのように反応するかを容易に予測することはできません。この全般的な性能傾向と特定の挙動の予測不可能性の間のギャップは、このようなモデルをデプロイする際の結果を予測することを困難にしています。

Risks and Policy Implications

大規模生成モデルの予測不可能性は、AIの安全性と政策に重大な課題をもたらします。特定の能力や出力が予測できないため、モデルはデプロイ前に検出が困難な、社会的に有害な挙動を示す可能性があります。

Anthropicは、スケーリングは予測可能だが挙動は予測不可能というこれらの相反する特性が、開発者のモデルデプロイの動機と、安全なデプロイを妨げる課題の両方に影響を与えると指摘しています。この研究は、出力の予測不可能性が、モデルがすべてのユーザーにとって有益かつ安全であることを保証することを困難にしていることを強調しています。

Proposed Interventions for AI Safety

予測不可能な創発的(emergent)能力に関連するリスクを軽減するため、Anthropicは、大規模生成モデルが有益な影響を与える可能性を高めるための介入策をAIコミュニティが実施すべきであると提案しています。この研究は、政策立案者、技術者、およびあらゆる分野の学術関係者が、AIシステムをより効果的に理解し、規制するためのリソースとして意図されています。

Sources

関連