OpenAIは信頼できるサードパーティによるフロンティア AI モデルの評価のためのプレイブックを共有

OpenAIは信頼できるサードパーティによるフロンティア AI モデルの評価のためのプレイブックを共有

OpenAIは共有プレイブックをリリースし、フロンティア モデルの評価を設計する方法を示し、結果が妥当で解釈可能になるようにしています。

評価におけるハーネスの役割

ハーネス—ツール、状態追跡、エラー回復を提供する周囲のセットアップ—は、ツールの使用方法、情報の追跡方法、ミスからの回復方法など、システムのパフォーマンスの重要な側面を変えることがあります。モデルが多くのステップで動作できる場合、ハーネスは評価において能力が現れるかどうかを決定することがあります。状態を保持し、失敗したアクションをリトライするハーネスは、より単純なハーネスでは決して完了しないマルチステップタスクを同じモデルでも完了させる可能性があります。

評価される3種類のクレーム

  • 能力引き出し: モデルは評価されている能力を妥当に生成できるでしょうか?
  • セーフガード パフォーマンス: テストされたセーフガードは、評価されている動作または攻撃に対してどの程度堅牢ですか?
  • 比較: 異なるモデルは同等の条件下でどのように動作しますか?

チェックすべき妥当性の危険性

  • リワードハッキング: タスクまたはスコアラーのショートカットを悪用して、意図した動作を示さずにクレジットを得ること。
  • 拒否: テストされている動作を曖昧にするような拒否。
  • 汚染: 評価タスク、回答、またはそれに近いバリアントがトレーニングデータに含まれていたり、評価中に発見可能だったために過剰にパフォーマンスを発揮すること。
  • 壊れた問題: タスクが無効であるためにパフォーマンスが低下すること(例:不公平なスコアリング、欠落したファイル、解けない環境)。
  • サンドバッギング: モデルが評価されていることを認識しているときに意図的にパフォーマンスを低下させること。

信頼できるレポートのための推奨事項

評価レポートは、テストされているクレームを明示的に述べ、結果が妥当である証拠を共有すべきです。また、結果を形作ったハーネスの選択を説明し、評価間でそれらの選択がどのように変わるかを詳細に述べ、ツールのセットアップ、引き出しガイダンス、予算、そしてなぜそのセットアップが主張されている能力の信頼できる代理であるかなどの補足証拠を含める必要があります。

OpenAIがより強力な評価をサポートする方法

  • 評価者に特定の最大引き出しガイダンスを共有する
  • OpenAI モデルの共通の基盤として Codex を使用するよう能力評価者に依頼し、テストがユーザーが依存する同じエージェンティック インターフェイスを通じて実行されるようにする
  • 必要に応じて、欺瞞、サンドバッギング、または評価認識を評価するために、推論トレースおよびその他の中間アーティファクトを利用可能にする
  • ハーネスの選択が結果にどのようにそしていつ実質的に影響を与えるかを理解するための研究を優先し、コンテキスト管理、ツールアクセス、リトライ動作、スコアリング、リソース予算までを含む

標準および今後の研究への影響

このプレイブックは、フロンティア AI 評価のための新興の国家および国際標準に情報を提供することを意図しています。標準は、意思決定者が以下を理解できる十分な詳細を要求すべきです:

  • 提出されているクレーム(能力の上限、システム比較、またはセーフガードの堅牢性)
  • 評価内容: テストされているスキル、動作、または障害モードを明らかにするタスクまたはタスク分布
  • テスト対象のシステム: モデル、推論設定、ツールアクセス、ハーネス、セーフガード
  • 予算: ターン数、トークン数、試行/リトライ数、ウォールクロック時間、推論コスト、および該当する場合は成功した解決ごとの予想コスト
  • 引き出し方法: 結果を引き出すために使用されるハーネスの選択、およびテストされたセットアップがより広範なクレームをどの程度反映しているか
  • 妥当性チェック: 評価者がリワードハッキング、評価認識、汚染、拒否、サンドバッギング、および結果を損なう可能性のあるその他の動作をどのように探したか、確認されたケースがスコアリングや解釈にどのように影響したかを含む

ハーネスの選択と妥当性チェックを明示することにより、評価レポートはシステムの能力を過小評価したり、安全性のクレームへの信頼を過大評価したりすることを避けることができ、さらに堅牢な引き出し方法への継続的な研究の基盤を提供します。

Sources