Anthropic Fable 가드레일이 사이버 보안 연구자들 사이에서 반발을 일으키다

지나치게 공격적인 안전 가드레일이 기술적 활용성을 제한한다

Anthropic이 공개한 Fable—사이버 보안에 초점을 맞춘 모델 Mythos의 공개 제한 버전—은 제한적인 안전 가드레일 때문에 사이버 보안 커뮤니티로부터 큰 비판을 받고 있습니다. 악성코드와 생물학적 무기 개발을 방지하기 위한 이 조치들은 종종 무해한 요청에서도 트리거되어, 많은 전문 보안 작업에 모델을 사용할 수 없게 만들고 있습니다.

연구자들은 Fable이 사이버 보안과 약간만 관련된 요청도 거부한다고 보고했습니다. IBM X-Force의 Valentina “Chompie” Palmiotti에 따르면, 모델은 블로그 글을 읽는 것과 같은 무해한 작업조차도 거부합니다. 다른 보고된 트리거로는 코드 리뷰 요청, 드롭퍼 페이로드 분석, OpenSSL 매개변수에 대한 질문 등이 있습니다.

조용한 모델 다운그레이드와 "키워드 기반" 필터링

프롬프트가 안전 가드레일을 트리거하면, Fable은 단순히 요청을 거부하는 것이 아니라, 종종 채팅을 일시 중지하고 자동으로 Claude Opus 4.8으로 전환합니다.

기술 전문가들은 필터링 메커니즘이 상황을 인식하기보다는 주로 키워드 기반이라고 제안합니다. Tolmo의 기술 직원인 Matt Suiche는 모델에게 보안 코드를 작성하도록 요청하면 종종 다운그레이드가 발생하는데, 이는 모델이 해당 요청을 "소프트웨어 엔지니어링 모범 사례"가 아니라 "사이버 보안 관련 작업"으로 해석하기 때문이라고 지적했습니다.

Hacker News 커뮤니티 회원들은 여러 구체적인 실패 사례를 강조했습니다:

  • Biological Triggers: 사용자는 "genetics"(유전학) 언급이나 사진에서 곰팡이를 식별해 달라는 요청이 생물무기 방어 체계를 트리거했다고 보고했습니다.
  • Academic Interference: 연구자들은 인구 연구와 유기 화학 관련 질문이 위험하다고 표시된다고 언급했습니다.
  • General Utility: 일부 사용자는 모스 부호 해독이나 미토콘드리아에 대한 질문과 같은 기본 작업조차도 안전 플래그가 발생했다고 보고했습니다.

위협 행위자에 대한 전략적 함의

Anthropic이 위험을 완화하기 위해 이러한 가드레일을 도입했지만, 일부 보안 전문가들은 이것이 의도치 않게 공격자를 돕는다고 주장합니다. 악성코드 작성자들이 생물학 및 사이버 보안 용어를 코드에 의도적으로 삽입해 LLM 기반 보안 스캐너가 가드레일에 걸리게 하고 분석을 중단시키려 한다는 보고가 있습니다.

"악성코드 작성자들은 가드레일에 매우 흥미를 느끼고 있습니다. 악성코드에 프롬프트를 추가하면 LLM 스캐너가 가드레일에 걸려 실행을 중단하게 만들 수 있습니다... 이 AI 시스템들은 위협 행위자들이 실제로 어떻게 작동하는지 전혀 모릅니다."

Anthropic의 대응 및 검증 프로그램

반발에 대응하여 Anthropic은 일부 정책을 철회하기 시작했다고 전해졌습니다. Wired의 보고에 따르면, 회사는 "우리는 최첨단 LLM 개발을 위한 Fable 5의 안전 장치를 가시화하도록 변경하고 있다"며 안전과 활용성의 균형에 대해 "잘못된 선택"을 했다고 인정했습니다.

정당한 전문가들을 위한 이러한 제한을 완화하기 위해 Anthropic은 Cyber Verification Program을 제공하고, OpenAI는 유사한 Trusted Access for Cyber 프로그램을 유지하고 있습니다. 이 프로그램에 승인된 신청자는 사이버 보안 작업에 모델을 사용할 때 제한이 적습니다. 그러나 일부 사용자는 이러한 면제에도 불구하고 Fable이 특정 작업(예: 개인 기기의 부트로더 해제)에서 여전히 거부를 트리거하고 Opus로 다운그레이드한다고 주장합니다.

Sources