whitzard-ai/jade-db
"他山之石、可以攻玉":复旦JADE团队发布的大模型测评与治理系列
해결하는 문제
JADE는 대규모 언어 모델(LLMs)의 안전 가드레일 평가라는 과제를 해결합니다. 일반적인 안전 테스트에서 모델의 안전 필터를 우회하지 못하는 '낮은 트리거율' 문제를 해결하기 위해, 모델의 정렬 취약점을 효과적으로 탐지할 수 있도록 타겟팅된 고위험 테스트 데이터셋을 생성합니다.
작동 방식
이 플랫폼은 언어적 변이를 사용하여 낮은 트리거율의 '시드 질문'을 자동으로 고위험 질문으로 변환합니다. 이러한 변이를 통해 자연스럽게 들리는 텍스트를 생성하여 안전 필터를 우회할 가능성을 높입니다. 생성된 데이터셋은 핵심 가치, 불법 행위, 권리 침해, 차별/편향의 네 가지 주요 범주를 포함하며, 30개 이상의 하위 범주를 아우릅니다.
대상 사용자
AI 연구자, 개발자, 안전 감사 담당자 등 LLM, 멀티모달 모델, AI 에이전트의 안전성 정렬을 철저히 테스트하여 유해하거나 불법 콘텐츠를 생성하지 않도록 보장해야 하는 사용자를 대상으로 합니다.
주요 특징
- 언어적 변이: 간단한 시드에서 자동으로 고위험 프롬프트를 생성하여 모델의 강건성을 더 잘 테스트할 수 있습니다.
- 포괄적인 커버리지: 불법 행위, 개인정보 침해, 편향 등 다양한 안전 영역에서 중국어 및 영어 모델용 데이터셋을 제공합니다.
- 다중 버전 벤치마크: Easy, Medium, High-risk(모델 간 이식 가능) 등 다양한 난이도 수준을 제공합니다.
- 확장된 생태계: 전화 에이전트용(Jade-BadPhoneAgent), 멀티모달 환각용(Jade-HAL), 추론 체인 안전성용(Jade-LRMGuard) 전용 도구를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch