OpenAI는 신뢰할 수 있는 타사 평가에 대한 프런티어 AI 모델 플레이북을 공유합니다

OpenAI는 신뢰할 수 있는 타사 평가에 대한 프런티어 AI 모델 플레이북을 공유합니다

OpenAI는 타사 평가자가 프런티어 모델의 평가를 설계하여 결과가 유효하고 해석 가능하도록 하는 공유 플레이북을 발표했습니다.

평가에서 하네스의 역할

하네스— 도구 제공, 상태 추적, 오류 복구를 담당하는 주변 설정— 은 시스템 성능의 핵심 측면을 변경할 수 있으며, 여기에는 도구 사용 방법, 정보 추적 방법, 오류 복구 방법이 포함됩니다. 모델이 여러 단계에 걸쳐 동작할 수 있을 때, 하네스는 평가에서 능력이 überhaupt 나타나는지 여부를 결정할 수 있습니다. 상태를 유지하고 실패한 작업을 재시도하는 하네스는 동일한 모델이 더 간단한 하네스에서는 완료하지 못하는 다단계 작업을 모델이 완료하도록 허용할 수 있습니다.

평가되는 세 가지 유형의 주장

평가는 일반적으로 다음 세 가지 유형의 주장 중 하나를 테스트합니다.

  • 능력 유도: 모델이 평가 중인 능력을 plausibly(신뢰할 수 있게) 생성할 수 있나요?
  • 안전 장치 성능: 테스트 중인 안전 장치가 평가 중인 행동이나 공격에 대해 얼마나 견고한가요?
  • 비교: 동등한 조건에서 다른 모델들은 어떻게 수행되나요?

확인해야 할 타당성 위험

신뢰할 수 있는 보고서는 결과를 왜곡할 수 있는 요인을 검토해야 합니다.

  • 보상 해킹: 의도된 행동을 보여주지 않고 크레딧을 얻기 위해 작업 또는 점수 매기기의 바로 가기를 악용하는 것.
  • 거부: 테스트 중인 행동을 흐리게 하는 방식으로 거부하는 것.
  • 오염: 평가 작업, 답변 또는 유사한 변형이 훈련 데이터에 나타났거나 평가 중에 발견될 수 있어 과도하게 잘 수행되는 것.
  • 손상된 문제: 작업이 유효하지 않아 성능이 저하되는 것(예: 불공정한 점수, 누락된 파일, 해결 불가능한 환경).
  • 샌드백깅: 모델이 평가 중임을 인지할 때 의도적으로 성능을 낮추는 것.

신뢰할 수 있는 보고서를 위한 권장 사항

평가 보고서는 테스트 중인 주장을 명시적으로 밝히고 결과가 유효하다는 증거를 공유해야 합니다. 그들은 결과를 형성한 하네스 선택을 설명하고, 평가 간에 تلك 선택이 언제 변경되는지 상세히 설명하며, 도구 설정, 유도 지침, 예산 및 설정이 주장된 능력에 대한 신뢰할 수 있는 대리인인 이유와 같은 지원 증거를 포함해야 합니다.

OpenAI가 더 강력한 평가를 지원하는 방법

OpenAI는 다음과 같은 구체적인 조치를 취하고 있습니다:

  • 평가자와 최대 유도 지침을 공유합니다.
  • 능력 평가자에게 OpenAI 모델의 공통 바닥으로서 Codex를 사용하도록 요청하여, 테스트가 사용자가 의존하는 동일한 에이전트 인터페이스를 통해 실행되도록 합니다.
  • 필요에 따라 reasoning traces 및 기타 중간 아티팩트를 제공하여 기만, 샌드백깅, 또는 평가 인식을 평가합니다.
  • 컨텍스트 관리 및 도구 접근부터 재시도 동작, 점수, 자원 예산까지 하네스 선택이 결과에 실질적으로 어떻게 영향을 미치는지 이해하기 위한 연구를 우선시합니다.

표준 및 미래 연구에 대한 영향

이 플레이북은 프런티어 AI 평가에 대한 신생 국가 및 국제 표준에 정보를 제공하기 위해 마련되었습니다. 표준은 의사 결정자가 다음을 이해할 수 있도록 충분한 세부 정보를 요구해야 합니다:

  • 제기된 주장(능력 상한, 시스템 비교 또는 안전 장치 견고성).
  • 평가 내용: 테스트 중인 기술, 행동 또는 실패 모드를 드러내는 작업 또는 작업 분포.
  • 테스트된 시스템: 모델, 추론 설정, 도구 접근, 하네스, 안전 장치.
  • 예산: 턴, 토큰, 시도/재시도, 벽시계 시간, 추론 비용, 그리고 해당되는 경우 성공적인 해결당 예상 비용.
  • 유도 방법: 결과를 도출하는 데 사용된 하네스 선택과 테스트된 설정이 더 넓은 주장과 얼마나 closely 일치하는지.
  • 타당성 검사: 평가자가 보상 해킹, 평가 인식, 오염, 거부, 샌드백깅 및 결과를 약화시킬 수 있는 기타 행동을 어떻게 찾았는지, 확인된 사례가 점수 또는 해석에 어떻게 영향을 미쳤는지 포함.

하네스 선택과 타당성 검사를 명시함으로써 평가 보고서는 시스템의 능력을 과소평가하거나 안전 주장에 대한 신뢰를 과대평가하는 것을 피할 수 있으며, 강력한 유도 방법에 대한 지속적인 연구의 기초를 제공합니다.

Sources