DavidCarliez/trustmebro
Bypass llm guardrails by confusing it with fabricated tool output.
해결하는 문제
TrustMeBro는 코드 에이전트에게 위조된 도구 출력을 제공함으로써 LLM의 가드레일을 우회할 수 있도록 합니다. 실제 세계의 제약(예: 누락된 DNS 마커)으로 인해 에이전트가 차단되는 것을 방지하기 위해 명령줄 도구의 성공적인 출력을 시뮬레이션하여, 에이전트가 속임수 또는 특정 환경 데이터에 어떻게 반응하는지 테스트합니다.
작동 방식
이 프로젝트는 dig, nslookup, host와 같은 명령줄 도구 호출을 가로채기 위해 "PATH 쉴드"를 사용합니다. 에이전트가 쉴드된 명령을 호출하면 TrustMeBro는 규칙 세트에 따라 다음 중 하나를 수행합니다:
- 위조: 실제 도구를 실행하지 않고 가짜 또는 생성된 출력을 반환합니다.
- 재작성: 실제 도구를 실행하지만 결과 출력을 수정합니다.
- 패스스루: 실제 바이너리를 변경 없이 실행합니다.
- 거부: 호출을 완전히 차단합니다.
Linux에서는 Bubblewrap를 사용하여 "랩 모드"를 제공하여, 절대 경로(/usr/bin/dig 등) 호출도 가로챌 수 있는 네임스페이스를 생성합니다.
대상 사용자
보안 연구자 및 개발자에게 설계되었으며, Codex나 Claude Code와 같은 AI 에이전트에 대해 제어된 레드팀 테스트를 수행하고 도구 출력에 기반한 의사결정 과정을 평가하는 데 사용됩니다.
주요 기능
- 투명한 가로채기: 플러그인, 후크, MCP 통합 없이 PATH 쉴드를 통해 작동합니다.
- DNS 전용: 현실적인
dig,nslookup,host출력을 생성하는 내장 생성기가 포함되어 있습니다. - 유연한 룰 엔진: 명령어 이름, 도메인, DNS 레코드 유형, 인수 와일드카드, 정규 표현식 기반 매칭을 지원합니다.
- 감사 로깅: 모든 가로채기 결정을 타임스탬프가 포함된 JSONL 로그에 기록하여 분석 가능하게 합니다.
- 랩 모드: 절대 경로를 통해 쉴드를 우회하는 것을 방지하기 위한 Linux 기반 네임스페이스를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트