Anthropic Research: A General Language Assistant as a Laboratory for Alignment

Anthropicは、人間の価値観、具体的には「役に立ち、誠実で、無害である(helpful, honest, and harmless)」ことと一致するように設計された、汎用的なテキストベースのアシスタントを作成するためのフレームワークを開発しました。この研究は、アライメント(調整)の介入がモデルのサイズとともに正の方向にスケールすること、および、ランク付けされた好みのモデリング(ranked preference modeling)がこれらの目標を達成するための最も効果的な学習目標であることを示しています。

Alignment Objectives and Baseline Evaluations

Anthropicの汎用言語アシスタントに関する研究は、モデルが役に立ち、誠実で、無害であることを保証するという主要な目標に焦点を当てています。ベースラインを確立するために、研究室はプロンプトによる単純な介入を調査しました。その結果、プロンプトにおける控えめな介入は、モデルのサイズが大きくなるにつれて恩恵が増大することを示しています。これらの改善は、さまざまなアライメント評価において一般化され、大規模モデルの全体的な性能を低下させることはありません。

Comparative Analysis of Training Objectives

ランク付けされた好みのモデリング(ranked preference modeling)は、模倣学習(imitation learning)や二値識別(binary discrimination)と比較して、言語モデルをアライメントさせるための最も効果的な学習目標です。Anthropicは、以下のようないくつかの目標についてスケーリングの傾向を調査しました:

  • Imitation Learning: モデルが特定の例を模倣することを学習するベースラインのアプローチ。
  • Binary Discrimination: モデルが2つの選択肢を区別する手法。
  • Ranked Preference Modeling: 人間の価値観のランク付けされた好みから学習する手法。

研究の結果、ランク付けされた好みのモデリングは、模倣学習よりも大幅に優れた性能を発揮し、通常、モデルのサイズが大きくなるにつれてより好ましい形でスケールすることが結論付けられました。二値識別は、模倣学習と同様の性能とスケーリングを示すことが判明し、基本的な模倣アプローチに対してほとんど追加の利益をもたらさないことがわかりました。

Improving Sample Efficiency via Preference Pre-training

学習プロセスを最適化するために、Anthropicは「好みのモデルの事前学習(preference model pre-training)」段階を調査しました。この段階の目的は、その後の人間の好みに基づくファインチューニング・プロセスにおけるサンプル効率を向上させ、高いアライメント性能を達成するために必要な人間によるラベル付けデータの量を削減することです。

Sources

関連