OpenAI が ChatGPT を紹介
OpenAI は、対話形式でのやり取りを目的とした会話型 AI モデル、ChatGPT を導入しました。この形式により、モデルはフォローアップ質問に答え、ミスを認め、誤った前提に挑戦し、不適切なリクエストを拒否することができます。
技術的手法:RLHF と GPT-3.5
ChatGPT は、2022 年初頭にトレーニングが完了した GPT-3.5 系列のモデルをファインチューニングしたバージョンです。このモデルは Azure AI のスーパーコンピューティングインフラを使用して開発され、人間のフィードバックからの強化学習(RLHF)で訓練されました。
トレーニングプロセスは、いくつかの主要な段階を含みました:
- 教師ありファインチューニング: 人間の AI トレーナーは、ユーザーと AI アシスタントの両方の役割を演じた会話を提供しました。これらのトレーナーは、モデルが生成した提案を使用して応答を作成しました。この対話データセットは、対話形式に変換された InstructGPT データセットと混合されました。
- 報酬モデルの作成: 強化学習を促進するために、OpenAI は AI トレーナーに会話内のランダムに選択されたメッセージに対する複数のモデル生成完了文をランク付けさせ、比較データを収集しました。
- Proximal Policy Optimization (PPO): 報酬モデルを用いて、モデルは PPO を使用して数回のイテレーションにわたりさらにファインチューニングされました。
主な機能と対話形式
従来のモデルとは異なり、ChatGPT の対話形式は、より自然で反復的なやり取りを可能にします。例えば、コーディングエラーが提示された場合、モデルは追加のコンテキストを求めたり、ユーザーの後続の説明に基づいて潜在的な修正案を提案したりできます。
さらに、モデルは誤った前提を扱う能力が向上しています。InstructGPT との比較では、2015 年にクリストファー・コロンブスが米国に到着したかどうかを尋ねた際、InstructGPT は事実と異なる回答をしましたが、ChatGPT は歴史的な不正確さを指摘し、前提に挑戦しつつも仮想シナリオとしてプロンプトに応答しました。
既知の制限事項
- Factuality: モデルは時に「説得力があるが誤っている、あるいは意味不明な回答」を生成します。これは RL 訓練時に真実の情報源が欠如していること、モデルが過度に慎重になり正しい回答を拒否するリスク、そして教師あり訓練が人間のデモンストレーターが知っていることに基づいてモデルを誤導する可能性があることに起因します。
- Sensitivity: モデルは入力の表現に敏感で、わずかに言い回しが変わるだけで同じプロンプトに対して異なる回答をすることがあります。
- Verbosity: 訓練データのバイアス(トレーナーが長く包括的に見える回答を好む)と過度の最適化により、モデルはしばしば過剰に冗長で、特定のフレーズを過度に使用します。
- Ambiguity: 曖昧な問い合わせに対して明確化質問を行う代わりに、モデルは通常ユーザーの意図を推測します。
- Safety: 不適切なリクエストを拒否する取り組みにもかかわらず、モデルは有害な指示に応答したり、偏った行動を示すことがあります。OpenAI は Moderation API を使用して安全でないコンテンツをブロックまたは警告しますが、偽陽性や偽陰性が発生します。
反復的なデプロイとフィードバック
ChatGPT は、ユーザーフィードバックを収集し、モデルの強みと弱みを学ぶためのリサーチプレビューとしてリリースされています。このリリースは、GPT-3 と Codex から得た教訓を活用し、RLHF を通じて有害かつ不正確な出力を削減するという OpenAI の反復的デプロイ戦略に沿ったものです。
OpenAI は、特に実世界の非敵対的な状況における有害な出力や新たなリスクとその緩和策に関する問題のある出力について、積極的にフィードバックを求めています。これを促進するために、重要な問題を特定したユーザーに API クレジットを提供する ChatGPT Feedback Contest を導入しました。
Sources
- OriginalIntroducing ChatGPT