コード合成大型言語モデルのためのハザード分析フレームワーク
OpenAIは、大規模言語モデル(LLM)で高度なコード合成が可能なもの(例:Codex)の展開に伴う安全リスクやハザードを明らかにするためのハザード分析フレームワークを開発しました。このフレームワークは、コード生成モデルが大きな利益をもたらす一方で、悪用の可能性、整合性の問題、技術分野の進展を加速させることで不安定化効果をもたらす可能性があるため、必要とされています。
多次元ハザード分析
ハザード分析フレームワークは、コード合成モデルの安全リスクを4つの主要な次元で評価します。
- 技術的リスク: モデルが持つ固有の制限や、不安全または誤ったコードを生成する可能性を評価します。
- 社会的リスク: これらのモデルの展開が社会構造や相互作用に与える影響を分析します。
- 政治的リスク: モデルが政治的安定やプロセスに影響を与える形で使用される可能性を評価します。
- 経済的リスク: コード合成の自動化によって引き起こされる経済的混乱の可能性を検討します。
コード生成能力の評価フレームワーク
ハザード分析に情報を提供するため、OpenAIは高度なコード生成技術の能力を測定する新しい評価フレームワークを活用しています。この評価は2つの主要指標に焦点を当てます。
- 仕様プロンプトの複雑性: フレームワークは、望ましいコードを指定するために使用されるプロンプトの複雑さと表現力をモデルがどのように処理するかを判断します。
- 人間相対的能力: フレームワークは、これらの仕様を理解し実行するモデルの能力を人間の能力と比較して評価します。
これらのベンチマークに対してモデルの能力を定量化することで、OpenAIはモデルのコード生成能力が有用なツールから潜在的なハザードへと転換する具体的な閾値をより明確に特定できます。