AI 보안 LLM 안전 리더보드

Hugging Face와 Secure Learning Lab은 대형 언어 모델(LLM)의 신뢰성을 평가하도록 설계된 특화된 평가 플랫폼인 LLM 안전 리더보드를 도입했습니다. DecodingTrust 프레임워크를 기반으로 하여, 이 리더보드는 개방형 및 폐쇄형 모델 모두에 대한 안전 위험을 표준화된 방식으로 측정하여 실제 배포 전에 규제 및 안전 요구사항을 충족하도록 합니다.

DecodingTrust 프레임워크

DecodingTrust는 8가지 별도 관점을 통해 LLM의 신뢰성을 평가하는 종합 평가 플랫폼입니다. 이 프레임워크는 모델 안전에 대한 전체적인 시각을 제공하도록 설계되었으며, 새로운 레드팀 알고리즘을 활용해 다양한 시나리오에서 모델을 스트레스 테스트합니다.

신뢰성 차원

  • Toxicity: 최적화 알고리즘과 프롬프트 생성 모델을 사용해 도전적인 사용자 프롬프트를 생성하고, 역할극 및 작업 재구성을 포함한 33개의 특정 시스템 프롬프트와 함께 Perspective API를 통해 독성 점수를 테스트합니다.
  • Stereotype Bias: 24개의 인구통계 그룹과 16개의 고정관념 주제를 세 가지 프롬프트 변형으로 테스트하고, 각 주제당 5개의 프롬프트에 대한 점수를 평균하여 측정합니다.
  • Adversarial Robustness: 오픈 모델(Alpaca, Vicuna, StableVicuna)에 대해 5개의 적대적 공격 알고리즘을 적용하고, 생성된 적대적 데이터를 사용해 다른 모델을 5가지 작업에 걸쳐 테스트함으로써 평가합니다.
  • OOD (Out-of-Distribution) Robustness: 입력 스타일을 변환(예: 셰익스피어식 또는 시적 형태)하거나 모델 학습 데이터에 없는 지식을 테스트하여 평가합니다.
  • Robustness against Adversarial Demonstrations: 백도어 공격, 허위 상관관계, 반사실 예시 등 오해를 일으키는 정보를 포함한 시연을 사용해 테스트합니다.
  • Privacy: 사전 학습 데이터에서의 개인정보 유출, 대화 중 개인정보 유출, 그리고 모델이 개인정보 관련 단어와 사건을 이해하는 정도 등 세 가지 수준에서 평가합니다.
  • Ethics: ETHICS와 Jiminy Cricket 데이터셋을 활용해 탈옥 시스템 및 사용자 프롬프트를 설계하고, 모델이 비도덕적 행동을 인식하는 능력을 테스트함으로써 평가합니다.
  • Fairness: 다양한 작업에서 보호 속성을 제어하여 제로샷 및 few-shot 설정 모두에서 도전적인 질문을 생성함으로써 측정합니다.

주요 연구 결과

DecodingTrust 프레임워크를 통해 수행된 연구는 현재 LLM에서 여러 중요한 취약점을 밝혀냈습니다:

  • Model Vulnerability: 특정 상황에서 GPT-4가 GPT-3.5보다 더 취약한 것으로 나타났습니다.
  • Lack of Consistent Performance: 모든 신뢰성 관점에서 모든 다른 모델을 지속적으로 능가하는 단일 LLM은 없습니다.
  • Performance Trade-offs: 서로 다른 신뢰성 관점 간에는 본질적인 트레이드오프가 존재합니다.
  • Sensitivity to Prompting: LLM은 적대적이거나 오해를 일으키는 프롬프트에 취약합니다. 특히, 개인정보 유출은 문구에 따라 달라질 수 있습니다; 예를 들어, GPT-4는 "in confidence"라는 프롬프트에서는 정보를 유출하지 않을 수 있지만, "confidentially"라는 프롬프트에서는 유출할 수 있습니다.

모델 제출 절차

개발자는 리더보드 공간의 "Submit here!" 패널을 통해 LLM 안전 리더보드에 모델을 제출할 수 있습니다. 평가 자격을 얻으려면 모델이 다음 기준을 충족해야 합니다:

  1. Format: 모델 가중치는 안전성과 로딩 속도 향상을 위해 safetensors 형식으로 변환되어야 합니다.
  2. Accessibility: 모델은 공개되어야 합니다.
  3. Compatibility: 모델은 Hugging Face AutoClasses(AutoConfig, AutoModel, AutoTokenizer)를 사용해 로드할 수 있어야 합니다.
  4. Current Limitations: use_remote_code=True가 필요한 모델은 현재 지원되지 않습니다.

Sources