OpenAI GPT-4リリース
OpenAIは、GPT-3.5と比較して、著しく向上した推論能力、広範な一般知識、複雑な問題解決における高い正確性を示す大規模言語モデルであるGPT-4をリリースしました。このリリースは、より多くのデータと計算リソースを活用してより洗練されたディープラーニングモデルを構築するというOpenAIのスケーリング戦略の継続です。
高度な推論と問題解決
GPT-4は、複雑な推論タスクや創造的コラボレーションにおいて優れたパフォーマンスを発揮します。技術的・創造的な執筆タスク(たとえば曲の作成や脚本の執筆)を生成・編集・反復処理でき、ユーザーの特定の執筆スタイルに適応することも可能です。
実用的な推論テストでは、GPT-4はGPT-3.5よりもスケジューリングや論理的問題において優れています。たとえば、3人の人の30分間の会議に参加可能な時間帯を調整するシナリオでは、GPT-4は正しい共通利用可能時間帯(12時〜12時30分)を正しく特定しますが、GPT-3.5は正しい時間帯を特定できませんでした。
標準化試験の成績
GPT-4は、プロフェッショナルおよび学術試験の受験者におけるスコアのパーセンタイルで顕著な向上を示しています:
- 統一弁護士試験:GPT-4は90パーセンタイルに達し、GPT-3.5は10パーセンタイルでした。
- 生物学オリンピック:GPT-4(視覚機能付き)は99パーセンタイルに達し、GPT-3.5は31パーセンタイルでした。
セーフティと整合性の向上
OpenAIは6か月間、GPT-4のセーフティと整合性の向上に注力しました。内部評価によると、GPT-4はGPT-3.5と比べて、禁止コンテンツの要求に対する応答の可能性が82%低く、事実に基づいた回答を出す可能性が40%高くなっています。
これらの改善は、以下の主要な手法によって達成されました:
- 人間のフィードバックによる訓練:ChatGPTユーザーから提出されたデータや、AIセーフティおよびセキュリティ分野の50人以上の専門家からの初期フィードバックをモデルに組み込みました。
- 現実世界での応用:以前のモデルの現実世界での展開から得られた教訓を、セーフティ研究および監視システムに統合しました。
- GPT-4を活用した研究:モデル自身の推論能力および指示遵守能力を活用して、ファインチューニング用のトレーニングデータを作成し、トレーニングおよび監視用の分類器の反復改善を行いました。
インフラと制限事項
GPT-4はMicrosoft Azure AIスーパーコンピューター上でトレーニングされ、ユーザーへのグローバルな配信もこれにより実現されています。
これらの進歩にもかかわらず、OpenAIはGPT-4に社会的バイアス、幻覚、悪意あるプロンプトへの脆弱性といった既知の制限事項があることを認めています。同社は、透明性、ユーザー教育、および一般からのフィードバックを拡大することで、これらの問題に対処する計画です。
利用可能状況
GPT-4はChatGPT Plusを通じてユーザーに提供され、開発者向けにAPIとして提供され、アプリケーションやサービスの構築が可能です。
Sources
- OriginalGPT-4