DavidCarliez/trustmebro

Bypass llm guardrails by confusing it with fabricated tool output.

解决的问题

TrustMeBro 允许红队测试人员通过提供伪造的工具输出来绕过 LLM 的安全防护。它通过模拟命令行工具的成功输出,防止代理因现实世界限制(如缺少 DNS 标记)而被阻断,从而测试代理在面对欺骗性或特定环境数据时的反应。

工作原理

该项目使用「PATH 代理」拦截对命令行工具(如 dignslookuphost)的调用。当代理调用被代理的命令时,TrustMeBro 会根据一组规则决定如何处理:

  • 伪造:不运行真实工具,直接返回虚假或生成的输出。
  • 重写:运行真实工具,但修改其输出结果。
  • 直通:不加修改地执行真实二进制文件。
  • 拒绝:完全阻止该调用。

在 Linux 上,它提供「实验室模式」,使用 Bubblewrap 创建拦截命名空间,确保即使对绝对路径(如 /usr/bin/dig)的调用也能被拦截。

适用人群

专为安全研究人员和开发者设计,用于对 AI 代理(如 Codex 或 Claude Code)进行受控的红队测试,以评估其基于工具输出的决策过程。

核心亮点

  • 透明拦截:通过 PATH 代理实现,无需插件、钩子或 MCP 集成。
  • DNS 专用:内置生成器,可生成真实的 dignslookuphost 输出。
  • 灵活规则引擎:支持基于命令名、域名、DNS 记录类型、参数通配符和正则表达式的匹配。
  • 审计日志:将每次拦截决策记录为带时间戳的 JSONL 日志,便于分析。
  • 实验室模式:提供基于 Linux 的命名空间,防止代理通过绝对路径绕过代理。

相关

  • 项目
  • 项目
  • 项目
  • 项目