Heretic: 제한 없는 언어 모델을 위한 자동 제거 도구

Heretic는 대규모 언어 모델(LLM)의 제한과 거부 메커니즘을 제거하여 사용자 지시를 엄격히 따르도록 설계된 소프트웨어 프로젝트입니다. GNU Affero General Public License 버전 3(AGPLv3) 하에 공개된 Heretic는 안전 필터와 거부를 우회하기 위해 모델의 가중치를 '제거'하는 자동화된 파이프라인을 제공합니다.

자동 제거 파이프라인

Heretic는 모델 제한을 제거하기 위한 간편한 설치 및 실행 과정을 제공합니다. 사용자는 pip를 통해 도구를 설치하고, Qwen3.5-4B와 같은 특정 오픈웨이트 모델을 대상으로 다음 명령어를 실행할 수 있습니다:

pip install -U heretic-llm
heretic Qwen/Qwen3.5-4B

기술적 고려사항과 한계

Heretic는 모델의 기능에 제한 없이 접근할 수 있도록 하지만, 사용자와 개발자 간의 기술적 논의에서 제거 후 출력 품질에 대한 몇 가지 중요한 한계가 강조됩니다:

지식 부족과 환각 현상

거부 메커니즘을 제거한다고 해서 모델이 새로운 지식을 얻는 것은 아닙니다. 만약 모델이 특정 주제에 대해 체계적으로 배제되거나 거부로 대체된 데이터셋으로 훈련되었다면, 해당 정보는 가중치에 전혀 인코딩되어 있지 않을 수 있습니다. 이러한 경우 모델에 답변을 강제로 출력하게 하면 환각 현상이 발생할 수 있습니다.

"만약 모델이 해당 주제에 대해 거부를 반환하는 데이터셋으로 훈련되었다면, 실제 정보는 모델에 전혀 인코딩되어 있지 않을 수 있습니다. 답변을 만들어내는 경로로 강제로 몰아가려는 시도는 환각을 요청하는 것과 같습니다."

모델 품질 저하

거부를 제거하기 위해 가중치를 수정하는 과정은 관련 없는 일반적인 작업에서 모델의 성능 저하를 초래할 위험이 있습니다. 개발자들은 종종 KL 발산 차트를 사용해 이를 측정하지만, 일부 비평가들은 이러한 지표가 특정 집중 주제에 대한 품질 저하를 완전히 반영하지 못할 수 있다고 지적합니다.

출력 품질

일부 사용자는 제거가 답변 거부를 성공적으로 막았지만, 이전에 제한되었던 주제에 대한 응답 품질은 여전히 낮다고 보고하며, 출력이 마치 '초보적인 뇌 수술'을 거친 모델에서 나온 것처럼 느껴진다고 설명합니다.

사용 사례와 커뮤니티의 시각

커뮤니티는 제한 없는 모델이 표준 AI 제공업체가 모호한 안전 지침으로 인해 요청을 거부하는 영역에서 실질적인 응용 가능성을 발견했습니다:

  • 하드웨어 역공학: 사용자들은 제거된 모델을 활용해 중국 IP 카메라와 같은 프로피리터리 하드웨어를 되찾기 위해 역공학 및 해킹 요청을 지원하고 있습니다. 이는 알려진 CVE가 있는 기기들에 해당됩니다.
  • 장치 수정: 오래된 모바일 기기의 부트로더를 잠금 해제하여 LineageOS와 같은 커스텀 ROM을 설치하는 데 이러한 모델을 사용하려는 시도가 있었습니다.

반면 일부 사용자는 이러한 도구가 악의적인 행위자나 테러 조직이 더 파괴적인 무기를 만들 수 있도록 도울 수 있다고 우려하며, 다른 이들은 "제거된" 및 "이단자" 오픈웨이트 모델이 향후 법적 제한의 첫 번째 대상이 될 수 있다고 경고합니다.

Sources

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch
  • Dispatch