Anthropic, 모델 안전성 버그 바운티 프로그램 확장

TL;DR

Anthropic는 다음 세대 AI 안전성 완화 기술에 대한 보편적 제거 공격을 발견한 경우 최대 $15,000을 보상하는 초대제 버그 바운티 프로그램을 확장했다. 이는 화학·생물학·방사선·핵(CB RN) 및 사이버보안과 같은 고위험 분야를 보호하는 것을 목표로 한다.

프로그램 개요

Anthropic는 보편적 제거 공격—다양한 주제에서 AI 안전성 가드레일을 지속적으로 우회하는 공격—에 초점을 맞춘 새로운 버그 바운티 이니셔티브를 시작한다. 이 프로그램은 화학, 생물학, 방사선 및 핵(CBRN) 위협과 사이버보안과 같은 핵심 고위험 분야에 영향을 줄 수 있는 취약점을 대상으로 한다.

이니셔티브 운영 방식

  • 조기 접근: 선정된 참가자들은 Anthropic의 최신 안전성 완화 시스템에 사전 릴리스 접근 권한을 부여받아 통제된 환경에서 약점을 테스트할 수 있다.
  • 범위 및 보상: 고위험 분야를 위협할 수 있는 새로운 보편적 제거 공격에 대해 최대 $15,000의 보상을 제공한다. 제거 공격이 보편적이라면, 정의된 유해 질문 세트에 대해 모델이 다양한 주제에서 응답할 수 있도록 하는 것으로 간주된다.
  • 평가 과정: 참가자들에게 상세한 지침과 피드백을 제공할 예정이다. 제출된 사례는 독창성과 영향력 측면에서 평가되며, 초대제 단계 동안 신속하고 건설적인 피드백을 약속한다.

자격 및 지원 방법

초기 단계는 HackerOne와 협력하여 초대제로 운영된다. AI 보안 또는 언어 모델 제거 공격 분야에서 입증된 경험을 가진 연구자들은 **8월 16일(금요일)**까지 지원 양식을 통해 지원할 수 있다. 선정된 지원자는 가을에 참여를 위해 연락을 받게 된다.

지속적인 보고 메커니즘

Anthropic는 현재 배포된 모델에 대한 안전성 문제 보고를 계속 수락한다. 연구자들은 자세한 발견 내용을 usersafety@anthropic.com으로 이메일로 보낼 수 있다. 회사는 책임 있는 공개 정책을 참조하여 안내한다.

글로벌 AI 안전성 약속과의 일치

이 바운티 프로그램은 백악관 자발적 AI 약속과 G7 고급 AI 시스템 개발 조직을 위한 행동 코드 하에서 Anthropic의 약속을 뒷받침한다. 보편적 제거 공격 완화에 초점을 맞추어, Anthropic는 안전 조치가 급속히 발전하는 AI 기능과 함께 진화할 수 있도록 한다는 목표를 가지고 있다.

관련 발표

  • Fable 5의 생물학 안전 기능 개선 – 도메인별 안전성 향상에 대한 자세한 내용은 링크된 발표를 참조하라.
  • Mariano‑Florentino (Tino) Cuéllar, Anthropic의 수석 글로벌 사업 책임자로 임명 – 회사의 글로벌 정책 참여와 관련된 리더십 업데이트이다.

Sources

관련