Continuum-AI-Corp/OrcaBonsai-27B-Uncensored
Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team
해결하는 문제
이 프로젝트는 원래 모델 가중치를 수정하지 않고 Ternary Bonsai 2 27B 모델에서 거부 행동(검열 해제)을 제거하는 방법을 제공합니다. 전통적인 "abliteration"은 일반적으로 가중치 수정을 필요로 하며, 이는 Bonsai 모델의 공격적인 1.72 bits/weight 양자화를 파괴하게 됩니다. 이 도구를 사용하면 모델은 비트 단위로 동일하고 압축된 상태를 유지하면서 추론 시 동작을 변경할 수 있습니다.
작동 방식
가중치를 편집하는 대신, 이 프로젝트는 **런타임 아블레이션(runtime ablation)**을 구현합니다. 학습된 "거부 방향" 벡터에 평행한 각 잔차 기여도의 성분을 제거하는 투영을 적용합니다.
구체적으로, 129개의 잔차 라이터(MLP 다운프로젝션, 선형 어텐션 출력 투영, 임베딩 토큰 포함)를 래핑하고 포워드 패스 중에 y ← y - α · dot(y, r) · r 공식을 적용합니다. 여기서 α는 개입 강도, r은 정규화된 거부 방향입니다.
대상 사용자
Apple Silicon(MLX를 통해) 또는 llama.cpp(rank-1 LoRA 어댑터 사용)에서 Ternary Bonsai 2 27B 모델을 사용하며, 유해한 과잉 거부와 무해한 과잉 거부를 포함하여 모델의 프롬프트 거부 경향을 줄이고자 하는 사용자를 위한 것입니다.
하이라이트
- 가중치 수정 없음: 원래 모델 가중치는 비트 단위로 동일하게 유지되어 재양자화 오류를 방지합니다.
- 런타임 제어: 아블레이션 강도(
alpha)와 대상이 되는 특정 레이어는 추론 중에 동적으로 조정할 수 있습니다. - 높은 능력 유지: 평가에 따르면, 아블레이션 후에도 모델의 일반적 능력(MMLU, GSM8K)은 안정적으로 유지됩니다.
- 크로스 플랫폼 지원: Apple Silicon/MLX용 구현, iOS용 Swift 레퍼런스, llama.cpp용 rank-1 LoRA 어댑터를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트