0ca/BoxPwnr

A modular framework for benchmarking LLMs and agentic strategies on security challenges across HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF and more.

解决的问题

BoxPwnr 是一个实验性框架,旨在测试大型语言模型(LLMs)和 AI 代理在自主解决 Capture The Flag(CTF)挑战和安全实验室方面的能力。它提供了一种标准化的方法,用于在多个网络安全平台上对不同的代理架构进行基准测试。

工作原理

系统通过一个迭代执行循环运行:

  1. 环境:命令通常在隔离的 Kali Linux Docker 容器中执行,必要时会自动设置 VPN。
  2. 代理循环:LLM(或 Claude Code、Grok 等 CLI 代理)接收系统提示并提出命令。这些命令在环境中执行,输出结果被反馈给 LLM 进行分析。
  3. 自动化:代理被指示提供完全自动化的命令,以避免手动干预。
  4. 追踪:系统记录完整的对话日志(追踪),跟踪 token 使用量和成本,并在成功时生成摘要。

适用人群

适用于对 AI 安全、代理工作流以及在复杂真实安全场景中评估 LLM 推理和问题解决能力的研究人员和开发者。

主要亮点

  • 广泛的平台支持:集成 16 个不同平台,包括 HackTheBox、PortSwigger、picoCTF、TryHackMe 和 XBOW。
  • 灵活的求解器选择:支持多种求解器,包括 single_loophacksynth(规划-执行-总结架构)以及 Cursor 和 Claude Code 等外部 CLI 工具。
  • 广泛的模型兼容性:通过 OpenRouter、NVIDIA NIM 和本地提供者(如 Ollama)支持多种模型。
  • 追踪分析:提供 Web 查看器,可逐步回放求解过程,分析 LLM 的推理逻辑。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目