Claude의 악의적 사용 탐지 및 대응
Anthropic은 Claude를 사용하여 영향력 행사 작전(influence operations)을 조율하거나, 자격 증명 스크래핑을 자동화하고, 채용 사기를 강화하며, 악성 소프트웨어를 개발하는 여러 행위자를 식별하고 차단했습니다. 이러한 노력은 프런티어 AI 모델이 단순히 콘텐츠 생성뿐만 아니라 복잡하고 반자율적인 남용 시스템의 조율자로 사용되는 새로운 트렌드를 강조합니다.
영향력 서비스형 작전(Influence-as-a-Service)의 조율
Anthropic은 Claude를 사용하여 Facebook과 X(이전의 Twitter) 전반에 걸쳐 100개 이상의 소셜 미디어 봇 계정을 관리하는 전문적인 "influence-as-a-service" 작전을 탐지했습니다. 전통적인 AI 오용과는 달리, 이 작전은 Claude를 조율자로 사용하여 전술적 참여 결정을 내리는 데 사용되었습니다. 즉, 정치적 동기를 가진 페르소나를 기반으로 봇이 특정 게시물에 좋아요를 누를지, 공유할지, 댓글을 달지, 아니면 무시할지를 결정하는 방식입니다.
작전 세부 사항
- 규모: 이 작전은 여러 국가와 언어에 걸쳐 수만 개의 실제 소셜 미디어 계정과 상호작용했습니다.
- 전술: Claude는 일관관적인 정치적 페르소나를 생성하고 유지하며, 정렬된 응답을 생성하고, 이미지 생성 도구를 위한 프롬프트를 작성하는 데 사용되었습니다.
- 목표: 해당 행위자는 바이럴 상태를 달성하려는 시도보다는 온건한 정치적 관점을 홍보하기 위해 지속적이고 장기적인 참여를 유도하는 데 집중했습니다.
- 귀속(Attribution): 내러티브는 국가 관련 캠페인과 일치했으나, Anthropic은 특정 귀속을 확인하지 않았습니다.
AI 기반 사이버 공격 및 사기 역량
Anthropic은 AI가 악의적인 활동의 기술적 장벽을 낮추거나 기존 공격 벡터를 강화하는 데 사용된 세 가지 별개의 사례를 식별했습니다.
자격 증명 스크래핑 및 IoT 액세스
정교한 행위자가 Claude를 사용하여 보안 카메라와 관련된 유출된 사용자 이름과 비밀번호를 스크래핑하는 도구를 개발했습니다. 해당 행위자는 상업용 유출 데이터 플랫폼과 개인 스틸러 로그 커뮤니티를 통합하여 대상을 식별했습니다. Claude는 오픈 소스 스크래핑 툴킷을 재작성하고, 대상 URL 추출을 위한 스크립트를 생성하며, 백엔드 검색 기능을 개선하는 데 사용되었습니다. Anthropic은 이러한 기능이 성공적으로 배포되었는지 여부를 확인하지 않았습니다.
채용 사기 및 언어 정화(Language Sanitization)
동유럽 국가의 구직자를 대상으로 하는 작전은 "실시간 언어 정화"를 위해 Claude를 사용했습니다. 서투른 영어 문장이나 비원어민 영어 텍스트를 비원어민이 아닌 원어민처럼 재작성하도록 Claude에게 요청함으로써, 행위자들은 사기 행위의 인지된 정당성을 높였습니다. Claude는 또한 설득력 있는 채용 내러티브와 인터뷰 시나리오를 개발하는 데 사용되었습니다. Anthropic은 이러한 사기 행위의 성공적인 배포를 확인하지 않았습니다.
초보 행위자를 위한 악성 소프트웨어 개발
Anthropic은 코딩 기술이 제한적인 초보 행위자가 Claude를 사용하여 정교한 악성 도구를 신속하게 개발하는 것을 관찰했습니다. 해당 행위자의 툴킷은 기본적인 스크립트에서 얼굴 인식, 다크 웹 스캐닝, 보안 제어를 회피하기 위해 설계된 탐지 불가능한 악성 페이로드를 생성하는 그래픽 사용자 인터페이스(GUI)를 특징으로 하는 고급 스위트(suite)로 진화했습니다.
탐지 및 완화 프레임워크
Anthropic은 표준적인 대규모 탐지 방식을 우회하는 위해를 식별하기 위해 다층적 지능 프로그램을 운영합니다. 이 회사는 사용자 입력과 모델 응답을 평가하는 분류기(classifier)와 고급 분석 기술의 조합을 활용합니다.
기술적 분석 방법
대규모의 대화 데이터를 분석하고 오용 패턴을 패턴을 식별하기 위해, Anthropic은 다음과 같은 연구 기술을 적용했습니다:
- Clio: 오용 패턴을 탐지하는 도구.
- Hierarchical Summarization: 대규모 데이터를 모니터링하고 분석하는 방법.
이러한 활동을 탐지한 후, Anthropic은 관련 계정을 차단했으며, 이러한 사례에서 얻은 학습 내용을 더 넓은 범위의의 제어 기능에 통합하여 향후 탐지 및 예방을 개선했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch