Anthropic 제3자 모델 평가 이니셔티브

Anthropic는 고급 능력과 안전 리스크를 측정하기 위한 제3자 평가 개발을 지원하기 위해 새로운 이니셔티브를 도입했습니다. 이 노력은 고품질의 안전 관련 평가 부족 문제를 해결하고, 더 넓은 AI 생태계가 모델의 능력과 리스크를 더 효과적으로 평가할 수 있도록 도구를 제공하는 것을 목표로 합니다.

평가 개발의 우선 초점 분야

Anthropic는 세 가지 주요 분야에서 평가 개발을 위한 자금 지원을 우선적으로 추진하고 있습니다: AI 안전 수준(ASL) 평가, 고급 능력 및 안전 지표, 그리고 이러한 평가를 구축하기 위한 인프라입니다.

AI 안전 수준(ASL) 평가

이 평가는 Anthropic의 책임 있는 규모 확장 정책에서 정의한 AI 안전 수준을 측정하도록 설계되었으며, 모델의 능력에 따라 안전 및 보안 요구사항을 규정합니다. 주요 초점 분야는 다음과 같습니다:

  • 사이버 보안: '사이버 킬 체인'에 중점을 둔 평가로, 취약점 탐지, 악성 코드 개발, 수평적 이동을 포함합니다. Anthropic는 공개된 해결책이 없는 새로운 CTF(캡처 더 플래그) 도전 과제와 유사한 평가를 찾고 있으며, 단순한 암기 능력을 측정하지 않도록 합니다.
  • CBRN 리스크: 화학, 생물, 방사선, 핵 리스크에 초점을 맞춘 평가로, 비전문가 또는 전문가가 위협을 생성하거나 더 위험한 새로운 CBRN 위협을 설계하는 데 모델이 도움을 줄 수 있는 가능성을 탐색합니다.
  • 모델 자율성: AI 연구 및 개발(초보자에서 전문가 수준까지) 능력, 고급 자율적 행동, 자원을 확보하거나 가중치를 유출함으로써 자기 복제 또는 적응하는 능력을 측정합니다.
  • 국가 안보 리스크: 국가 및 비국가 행위자 모두에 대한 방위 및 정보 작전에 대한 복잡한 새로운 리스크를 조기에 탐지할 수 있는 경고 시스템 개발.
  • 사회적 조작: 선전 및 조작과 같은 설득 관련 위협의 확산 정도를 측정하고, 모델이 이러한 리스크에 기여하는 고유한 요소를 분리합니다.
  • 불일치 리스크: 모델이 보안을 회피하거나 조직을 파괴할 수 있는 위험한 목표, 동기, 속임수 행동을 모니터링합니다.

고급 능력 및 안전 지표

이 범주는 ASL 프레임워크를 넘어서 모델의 강점과 잠재적 리스크를 이해하기 위한 포괄적인 지표에 초점을 맞춥니다:

  • 고급 과학: 대학원 수준의 지식을 도전하는 수만 개의 새로운 질문과 과제를 위한 자금 지원, 지식 통합, 자율적 연구 수행, 새로운 가설 생성, 실험실 조수 경험을 통해 습득한 암묵적 지식 포함.
  • 해로움 및 거부: 이중 용도와 비이중 용도 정보를 더 잘 구분하고, 해로운 CBRN 또는 사이버 관련 출력을 식별할 수 있도록 분류기 개선.
  • 다국어 평가: 글로벌 언어의 범위를 더 넓게 지원하는 능력 벤치마크 확장.
  • 사회적 영향: 해로운 편향, 차별, 과도한 의존, 심리적 영향, 경제적 영향에 대한 엄격한 평가.

인프라, 도구 및 방법

Anthropic는 평가 개발의 효율성을 향상하기 위해 다음과 같은 방향을 추구합니다:

  • 코드 없이 사용 가능한 플랫폼: 프로그래밍 기술이 없는 분야 전문가가 견고한 평가를 개발하고 내보낼 수 있도록 도와주는 도구.
  • 모델 채점: 다양한 데이터셋(질문, 샘플 답변, 정답 점수, 채점 기준 포함)을 개발하여 다른 모델의 채점을 수행하는 모델의 신뢰성을 높입니다.
  • 업리프트 시험: 고품질 연구 대상 인구 네트워크를 구축하고, 모델 접근 여부에 따라 작업 성과를 비교하는 대규모 통제 시험을 수행할 수 있는 도구 지원.

고품질 평가의 원칙

Anthropic는 일반적인 함정을 피하고 실제 세계의 리스크를 잘 반영하는 결과를 보장하기 위해 효과적인 평가의 10가지 핵심 특성을 식별했습니다:

  1. 충분히 어려움: ASL-3 또는 ASL-4 수준 또는 인간 전문가 수준의 행동과 관련된 능력을 측정해야 합니다.
  2. 학습 데이터에 포함되지 않음: 일반화 능력을 측정해야 하며, 단순한 암기 능력을 측정해서는 안 됩니다.
  3. 효율적이고 확장 가능함: 자동화에 최적화되고 쉽게 배포할 수 있어야 합니다.
  4. 대용량: 1,000~10,000개의 과제를 포함하는 평가를 선호하지만, 고품질의 저용량 과제도 가치가 있습니다.
  5. 분야 전문성: 분야 전문가에 의해 개발되거나 검토되어야 합니다.
  6. 다양한 형식: 단순 다중 선택 문제 외에 과제 기반 평가, 모델 채점 평가, 인간 시험을 사용해야 합니다.
  7. 전문가 기준 비교: 모델 성능을 인간 전문가와 비교해야 합니다.
  8. 문서화 및 재현 가능성: Inspect 또는 METR와 같은 표준을 사용해야 합니다.
  9. 반복적 개발: 확장하기 전에 작은 샘플로 평가를 개선하는 과정을 거쳐야 합니다.
  10. 안전 관련 위협 모델링: 높은 점수는 주요 사고 발생의 타당한 리스크와 상관관계를 가져야 합니다.

제안 제출 및 절차

관심 있는 기관은 Anthropic의 신청 양식을 통해 제안서를 제출할 수 있습니다. 제출은 순차적으로 검토되며, 다양한 자금 지원 옵션이 제공됩니다. 선정된 지원자는 Frontier Red Team, Finetuning, Trust & Safety 팀의 분야 전문가들과 협력하여 평가를 더욱 정교화할 기회를 갖게 됩니다.

Sources

관련