p-e-w/heretic

Fully automatic censorship removal for language models

해결하는 문제

Heretic는 Transformer 기반 언어 모델에서 "안전 정렬(safety alignment)"(검열)을 제거합니다. 이 도구의 목표는 모델이 프롬프트에 대한 답변을 거부하는 것을 방지하는 동시에, 원래 모델의 지능과 능력을 최대한 보존하여 이러한 수정을 위해 일반적으로 요구되는 비용이 많이 드는 사후 학습(post-training)을 피하는 것입니다.

작동 원리

Heretic는 방향성 어블레이션(directional ablation, 또는 "abliteration")이라고 불리는 기술을 사용합니다. 이 기술은 모델의 은닉 상태(hidden states)에서 "유해한" 프롬프트와 "무해한" 프롬프트를 처리할 때의 차이인 "잔차 방향(residual directions)"을 식별합니다. 그런 다음 모델의 가중치 행렬(구체적으로 attention out-projection 및 MLP down-projection)을 직교화하여 해당 거부 방향의 표현을 억제합니다.

이 프로세스를 자동화하기 위해 Heretic는 TPE 기반 파라미터 최적화 도구(Optuna 사용)를 사용하여 최적의 어블레이션 파라미터를 찾습니다. 거부 횟수 최소화와 원래 모델과의 KL 발산(KL divergence) 최소화 사이의 균형을 최적화하여 모델이 "망가지거나" 지능을 잃지 않도록 합니다.

대상 사용자

  • LLM 사용자: Transformer 내부 구조에 대한 깊은 지식 없이도 기존 모델의 검열되지 않은 버전을 원하는 사람들.
  • AI 연구자: 모델 해석 가능성 및 모델 내부의 의미론을 연구하는 사람들. Heretic의 research 확장은 잔차 벡터를 플로팅하고 잔차 기하학을 분석하기 위한 도구를 제공합니다.

주요 특징

  • 완전 자동화: 어블레이션 파라미터의 수동 조정이 필요하지 않습니다. 도구가 최적의 설정을 자동으로 찾아냅니다.
  • 폭넓은 지원: 대부분의 dense 모델, 다양한 MoE 아키텍처 및 Qwen3.5와 같은 하이브리드 모델에서 작동합니다.
  • 유연한 어블레이션: 유연한 가중치 커널과 잔차 방향의 선형 보간을 사용하여 단순한 레이어별 어블레이션보다 더 나은 방향을 찾습니다.
  • 해석 가능성 도구: 모델의 내부 상태가 레이어를 통해 어떻게 변하는지 시각화하기 위해 PaCMAP 투영 및 잔차 벡터 애니메이션을 생성하는 기능이 포함되어 있습니다.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch