大規模言語モデルにおけるスケーラブルな監視の進捗を測定する
Anthropicは、人間の能力を超えるスキルを持つAIシステムを監視するという課題である、スケーラブルな監視(scalable oversight)の進捗を測定するためのフレームワークを導入しました。安全で有用な汎用AIを開発するには、ほとんどのタスクに関連するスキルにおいて人間を凌駕する可能性のあるシステムを、人間が監視する方法が必要であるため、この研究は極めて重要です。
スケーラブルな監視の課題
スケーラブルな監視とは、特定のタスクに関連するほとんどのスキルにおいて、人間を凌駕する可能性のあるAIシステムを監視するという問題を指します。これを経験的に研究する上での主な困難は、現在の汎用AIシステムが、まだすべての領域において広範に人間の能力を超えていないことです。
スケーラブルな監視のための実験デザイン
現在のモデルを用いてスケーラブルな監視を研究するために、Anthropicは、人間の専門家は成功するが、補助のない人間と現在の汎用AIシステムの両方が失敗するタスクを中心とした実験デザインを提案しています。このアプローチにより、研究者は人間の専門家を正解の基準(ground truth)として使用しながら、モデルが非専門家の人間を専門家レベルのパフォーマンスに到達させるための支援ができるかどうかをテストできます。
概念実証の結果
Anthropicは、MMLU (Massive Multitask Language Understanding) と、時間制限のある QuALITY という2つの質問回答タスクを使用して、概念実証実験を行いました。この実験では、人間が信頼性の低い大規模言語モデル(LLM)の対話アシスタントとチャットを通じてやり取りを行う、スケーラブルな監視のベースライン戦略をテストしました。
この実験の主な結果は以下の通りです:
- 人間のパフォーマンスの向上: LLMアシスタントとやり取りを行う人間の参加者は、自分自身の補助なしのパフォーマンスを大幅に上回りました。
- システムのパフォーマンスの向上: 人間とAIのコラボレーションは、単独で動作するモデルを上回りました。
- 研究の実現可能性: 結果は、たとえモデルが信頼できない場合であっても、現在のモデルを使用してスケーラブルな監視を研究することが可能であることを示しています。
AIの安全性への影響
これらの知見は、大規模言語モデルが困難なタスクにおいて人間を生産的に支援できるという最近の証拠を強化するものです。人間が複雑なタスクにおいて自身のパフォーマンスを向上させるためにLLMを使用できることを示すことで、研究者たちは、AIシステムの能力が増大するにつれて、人間がAIシステムの監視を維持するための道筋が存在することを示唆しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch