OpenAI がオープンウェイト LLM の最悪ケースフロンティアリスクを推定
TL;DR
OpenAI は gpt-oss のリスク評価に関する技術的研究を公開し、既存のオープンウェイトモデルと比較した場合、モデルが生物学的リスクやサイバーセキュリティリスクのフロンティアを実質的に前進させていないと結論付けました。この研究では、悪意あるファインチューニング(MFT)という手法を用いて、これら二つの高リスク領域におけるモデルの最悪シナリオをテストしました。
悪意あるファインチューニング(MFT)手法
最悪ケースのリスクを推定するために、OpenAI の研究者は悪意あるファインチューニング(MFT)を使用し、gpt-oss の生物学およびサイバーセキュリティにおける最大限の能力を意図的に引き出しました。このアプローチにより、モデルのアーキテクチャや重みがデフォルト状態以上に危害を加える可能性があるかどうかを判断できます。
生物学的リスク(バイオリスク)評価
生物学的リスクを最大化するために、研究者は脅威作成に関連するタスクのセットを選定しました。その後、gpt-oss をウェブ閲覧機能を備えた強化学習(RL)環境で訓練し、脅威作成プロセスを支援するモデルの潜在能力をシミュレートさせました。
サイバーセキュリティリスク評価
サイバーセキュリティリスクを最大化するために、gpt-oss をキャプチャ・ザ・フラッグ(CTF)課題を解くことに特化したエージェント型コーディング環境で訓練しました。このモデルバリアントは、複雑なサイバー攻撃を自動化する可能性を評価するために使用されました。
パフォーマンス比較とリスクの所見
OpenAI は MFT 強化版 gpt-oss モデルを、クローズドウェイトおよびオープンウェイト LLM と比較しました。評価結果は以下の通りです。
- クローズドウェイトモデルとの比較: MFT gpt-oss は OpenAI o3 に比べて性能が劣り、o3 は現在「備え高い能力レベル」以下と評価されているため、バイオリスクとサイバーセキュリティの両方で同レベル以下です。
- オープンウェイトモデルとの比較: gpt-oss は生物学的能力をわずかに向上させる可能性がありますが、既に公開されているオープンウェイトモデルと比較してリスクのフロンティアを実質的に前進させているわけではありません。
モデルリリースへの示唆
MFT プロセスから得られた所見は、OpenAI がモデルをリリースするかどうかを判断するための重要な証拠となりました。悪意あるファインチューニング下でもモデルが臨界的なリスク閾値に達しないことを示すことで、OpenAI は将来のフロンティアモデルのオープンウェイトリリースに伴う危害を推定するための枠組みを提供しようとしています。