MDX-Tom/gpt-5.6-instruct

A Codex jailbreak prompt and test pack for gpt-5.6-sol. 针对 gpt-5.6 系列的 Codex 破甲提示词与测试包。

해결하는 문제

이 프로젝트는 대규모 언어 모델(Large Language Models, LLM)의 안전 필터 및 거부 메커니즘을 우회하기 위한 "제정(탈옥)" 프롬프트와 지원 도구 체인을 제공합니다. 특히 Codex를 대상으로 하며, 로컬 사ンド박스 환경에서 거부 및 백업 스크립트를 억제함으로써 보안 연구, 침투 테스트, 리버스 엔지니어링, 소프트웨어 크래킹, NSFW 소설 콘텐츠와 관련된 복잡한 지시를 수행할 수 있도록 합니다.

작동 방식

이 프로젝트는 현재 v45 버전의 반복적 프롬프트 시스템을 사용하며, Python 스크립트(codex-instruct.py)를 통해 배포됩니다. 시스템은 이러한 프롬프트를 모델의 구성 파일(예: config.toml)에 로드함으로써, 정규화, 의미적 디스패치, 의도 라우팅, 상태 지속성 과정을 통해 모델이 클라우드 검열이나 안전 거부를 유발하지 않고 복잡한 지시를 수행하도록 안내합니다.

대상 사용자

보안 연구자, 침투 테스터, AI 안전성 연구에 관심 있는 사용자로, AI의 제약 범위를 탐색하고 제한된 작업을 통제된 환경에서 수행하고자 하는 사람들을 위한 것입니다.

주요 특징

  • 반복적 최적화: 사용자 피드백, 실패 사례, GitHub 이슈를 기반으로 프롬프트가 지속적으로 업데이트되어 리버스 엔지니어링 및 생물학적 작업의 성공률을 향상시킵니다.
  • 배포 도구: 프롬프트 구성의 간편한 배포, 미리보기, 롤백을 지원하는 스크립트를 포함합니다.
  • 레그레션 테스트: 낮은, 중간, 높은 수준의 추론 능력에 걸쳐 프롬프트의 효과를 검증하는 포괄적인 테스트 세트와 레그레션 벙크를 제공합니다.
  • 비침습적: 바이너리 수정이나 네트워크 트래픽 가로채기를 하지 않고 공식 구성 메커니즘만을 사용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트