DavidCarliez/trustmebro
Bypass llm guardrails by confusing it with fabricated tool output.
解决的问题
TrustMeBro 允许红队测试人员通过提供伪造的工具输出来绕过 LLM 的安全防护。它通过模拟命令行工具的成功输出,防止代理因现实世界限制(如缺少 DNS 标记)而被阻断,从而测试代理在面对欺骗性或特定环境数据时的反应。
工作原理
该项目使用「PATH 代理」拦截对命令行工具(如 dig、nslookup 或 host)的调用。当代理调用被代理的命令时,TrustMeBro 会根据一组规则决定如何处理:
- 伪造:不运行真实工具,直接返回虚假或生成的输出。
- 重写:运行真实工具,但修改其输出结果。
- 直通:不加修改地执行真实二进制文件。
- 拒绝:完全阻止该调用。
在 Linux 上,它提供「实验室模式」,使用 Bubblewrap 创建拦截命名空间,确保即使对绝对路径(如 /usr/bin/dig)的调用也能被拦截。
适用人群
专为安全研究人员和开发者设计,用于对 AI 代理(如 Codex 或 Claude Code)进行受控的红队测试,以评估其基于工具输出的决策过程。
核心亮点
- 透明拦截:通过 PATH 代理实现,无需插件、钩子或 MCP 集成。
- DNS 专用:内置生成器,可生成真实的
dig、nslookup和host输出。 - 灵活规则引擎:支持基于命令名、域名、DNS 记录类型、参数通配符和正则表达式的匹配。
- 审计日志:将每次拦截决策记录为带时间戳的 JSONL 日志,便于分析。
- 实验室模式:提供基于 Linux 的命名空间,防止代理通过绝对路径绕过代理。
相关
- 项目
- 项目
- 项目
- 项目