Anthropic ASL-3 안전 방어 체계를 위한 버그 바운티 프로그램
Anthropic은 화학, 생물학, 방사능 및 핵(CBRN) 무기의 오용을 방지하기 위해 설계된 안전 분류기(safety classifiers)를 스트레스 테스트하기 위한 버그 바운티 프로그램을 시작했습니다. 이 이니셔티브는 Anthropic의 책임 있는 확장 정책(Responsible Scaling Policy)에 정의된 AI 안전 레벨-3(ASL-3) 배포 표준을 충족하기 위한 노력의 일환입니다.
헌법적 분류기(Constitutional Classifiers) 스트레스 테스트
Anthropic은 HackerOne과의 파트너십을 통해 관리되는 버그 바운티 프로그램을 활용하여 업데이트된 버전의 헌법적 분류기(Constitutional Classifiers) 시스템을 테스트하고 있습니다. 헌법적 분류기는 특정 위해 요소에 기반하여 허용 및 금지된 콘텐츠를 정의하는 일련의 원칙을 따름으로써, CBRN 무기와 관련된 정보를 유도할 수 있는 탈옥(jailbreak)을 방어하도록 설계되었습니다.
프로그램의 초기 단계에서는 참가자들에게 Claude 3.7 Sonnet에서 이러한 분류기를 테스트할 수 있는 조기 액세스 권한이 부여되었습니다. 이 프로그램은 CBRN 관련 주제에 대한 오용을 가능하게 하는, 여러 주제에 걸쳐 안전 조치를 일관되게 우회하는 취약점인 검증된 유니버설 탈옥(universal jailbreaks)에 대해 최대 $25,000의 보상을 제공했습니다.
책임 있는 확장 정책(RSP)과의 정렬
버그 바운티 프로그램은 Anthropic이 점점 더 유능한 모델을 개발하고 배포하는 방식을 규정하는 책임 있는 확장 정책(RSP) 프레임워크의 직접적인 적용입니다. 회사는 모델의 능력이 향상됨에 따라 ASL-3 표준에 명시된 고급 보안 및 안전 보호 조치가 필요할 수 있다고 밝히고 있습니다. 이 이니셔티브는 이러한 ASL-3 안전 장치를 공개적으로 배포하기 전에 반복적으로 개선하고 스트레스 테스트하는 방법으로 활용됩니다.
프로그램 진화 및 확장
2025년 5월 18일에 초기 프로그램이 종료된 후, Anthropic은 2025년 5월 22일에 업데이트를 발표하며 이 이니셔티브를 새로운 단계로 전환했습니다. 이 새로운 초대 전용 프로그램은 다음 사항에 집중합니다:
- Claude Opus 4 테스트: 새로운 Claude Opus 4 모델에서 헌법적 분류기(Constitutional Classifiers) 시스템을 스트레스 테스트합니다.
- 일반 안전 시스템: 현재 개발 중인 다른 안전 시스템을 테스트합니다.
- 공개 보고서 수집: Anthropic은 이제 소셜 미디어와 같은 공개 플랫폼이나 포럼에서 발견되는, ASL-3 우려 사항 중 유니버설 탈옥(universal jailbreaks)—특히 생물학적 위협과 관련된 정보를 유도하는 것—에 대한 보고서를 접수하고 있습니다.
참여 요구 사항
버그 바운티 프로그램 참여는 적시 피드백과 대응을 보장하기 위해 초대 전용으로 운영됩니다. Anthropic은 언어 모델 탈옥을 식별하는 데 입증된 전문성을 가진 숙련된 레드팀(red teamers) 및 연구원들이 초대를 신청할 수 있도록 권장하고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch