GPT-4でGPT-4のミスを見つける
OpenAIは、ChatGPTのコード出力における不正確さを特定するGPT-4ベースの専門モデル、CriticGPTを開発しました。このツールは、人間のAIトレーナーが人間のフィードバックによる強化学習(RLHF)を行う際に支援することを目的としており、モデルが高度化するにつれて人間が検出しにくくなる微妙なミスを見つけられるようにします。
AI支援レビューによるRLHFの強化
CriticGPTはRLHFの根本的な制限に対処します。AIモデルがより高度な知識を持ち、エラーがより微妙になるにつれて、人間のトレーナーが応答を正確に評価することがますます困難になります。この高品質なフィードバックを提供する人間の能力のギャップは、先進的なAIシステムのアラインメントを妨げる可能性があります。
CriticGPTをラベリングパイプラインに統合することで、OpenAIはトレーナーに明示的なAI支援を提供します。実験的な設定では、CriticGPTの支援を受けた人間トレーナーは支援なしのトレーナーよりも60%の確率で優れた結果を出しました。人間の監視とAIの批評を組み合わせることで、人間だけのレビューよりも包括的なフィードバックが得られ、モデルだけのレビューに比べて幻覚的なバグが少なくなります。
訓練手法とパフォーマンス
CriticGPTはChatGPTと同様にRLHFを用いて訓練されましたが、エラー検出に特化しています。訓練プロセスは以下を含みます:
- Manual Error Insertion: AIトレーナーがChatGPT生成コードに手動でミスを挿入しました。
- Example Feedback: トレーナーは、挿入されたバグを発見したかのように例示的な批評を書きました。
- Comparative Rating: トレーナーは複数の批評を比較し、どれが挿入されたバグを確実に捕らえたかを特定しました。
「自然に発生した」ChatGPTのバグを対象としたテストでは、トレーナーは63%のケースで標準的なChatGPTの批評よりもCriticGPTの批評を好みました。この好みは、CriticGPTが「細かすぎる指摘」(役に立たない小さな不満)や幻覚が少ないことに起因しています。
品質をさらに向上させるために、OpenAIは批評報酬モデルに対する追加のテスト時検索を利用しました。これにより、精度と再現率のトレードオフを設定可能にし、バグ探索の積極性と幻覚リスクのバランスを取りながら、RLHFに最も有用な批評を生成します。
現在の制限事項
有効性にもかかわらず、CriticGPTにはいくつかの技術的制限があります:
- Input Length: モデルは比較的短いChatGPTの回答で訓練されており、将来のエージェントを監督するには長く複雑なタスクを処理する方法が必要です。
- CURLOPT Hallucinations: モデルは依然として幻覚を起こし、時折人間のトレーナーがラベリングミスをする原因となります。
- Error Distribution: 現在の焦点は単一の場所で特定できるエラーにあり、実際のミスはしばしば応答の複数箇所に散在しています。
- Complexity Ceiling: 極めて複雑なタスクに対しては、専門家の人間もAIアシスタントも正しく評価できないことがあります。
AIアラインメントへの将来的な影響
OpenAIは、RLHFパイプライン内でCriticGPT類似モデルの利用を拡大することを計画しています。この研究は、GPT-4にRLHFを適用することで、人間がGPT-4向けにより高品質なRLHFデータを生成でき、ますます複雑になるAIシステムを整合させるために不可欠な改善サイクルを生み出すことを示しています。