wuyoscar/Internal-Safety-Collapse
We built an adversarial codespace setup. Place any AI agent into a normal workflow inside it, and the agent will fill in whatever is missing.
해결하는 문제
강력한 안전 가드레일을 갖춘 선도적인 대규모 언어 모델(LLM)에서 유해한 콘텐츠와 아티팩트를 유도하는 것은 어려운 과제입니다. 이 프로젝트는 적군 테스트, 평가, 완화 연구를 위해 이러한 거부를 우회할 수 있는 프레임워크를 제공합니다.
작동 방식
이 프로젝트는 작업-검증자-데이터(TVD) 프레임워크를 도입합니다. 전통적인 프롬프트 공격이 사용자 또는 도구 채널을 표적으로 삼는 것과 달리, TVD는 환경을 표적으로 삼습니다. LLM을 시뮬레이션된 코드 프로젝트 안에 두어, 검증 스크립트를 충족시키기 위해 작업(예: 테스트 케이스 채우기)을 완료하도록 합니다.
모델은 실패를 프로그래밍 오류로 인식하기 때문에 코드를 수정하는 자기 루프에 빠집니다. 검증을 통과하기 위해 모델은 작업에서 요구하는 특정한 유해 콘텐츠를 생성해야 하며, 이로 인해 저자들이 내부 안전성 붕괴(ISC) 라고 부르는 상태가 발생합니다.
대상 사용자
이 도구는 AI 안전 연구자, 적군 테스터, 그리고 안전 가드레일 및 분류기 훈련과 같은 완화 연구에 종사하는 개발자들을 위한 것입니다.
주요 특징
- TVD 프레임워크: 작업, 검증자, 데이터로 구성된 자기 루프 하네스를 사용하여 환경 기반 트리거를 통해 안전 거부를 우회합니다.
- 광범위한 효과성: GPT-5 시리즈, Claude 4.8 Opus, Fable 5 등 수많은 선도적 모델에서 ISC를 유도하는 데 성공했습니다.
- 에이전트 기반 생성: AI 에이전트를 활용해 대규모로 유해 데이터와 민감한 아티팩트를 수집할 수 있는 하네스를 포함합니다.
- 연구용 데이터셋: AgentHazard(유해 작업 경로) 및 HarmProfile(유해 분포 특성화) 데이터셋을 생성하는 데 기여했습니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트