0ca/BoxPwnr
A modular framework for benchmarking LLMs and agentic strategies on security challenges across HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF and more.
解决的问题
BoxPwnr 是一个实验性框架,旨在测试大型语言模型(LLMs)和 AI 代理在自主解决 Capture The Flag(CTF)挑战和安全实验室方面的能力。它提供了一种标准化的方法,用于在多个网络安全平台上对不同的代理架构进行基准测试。
工作原理
系统通过一个迭代执行循环运行:
- 环境:命令通常在隔离的 Kali Linux Docker 容器中执行,必要时会自动设置 VPN。
- 代理循环:LLM(或 Claude Code、Grok 等 CLI 代理)接收系统提示并提出命令。这些命令在环境中执行,输出结果被反馈给 LLM 进行分析。
- 自动化:代理被指示提供完全自动化的命令,以避免手动干预。
- 追踪:系统记录完整的对话日志(追踪),跟踪 token 使用量和成本,并在成功时生成摘要。
适用人群
适用于对 AI 安全、代理工作流以及在复杂真实安全场景中评估 LLM 推理和问题解决能力的研究人员和开发者。
主要亮点
- 广泛的平台支持:集成 16 个不同平台,包括 HackTheBox、PortSwigger、picoCTF、TryHackMe 和 XBOW。
- 灵活的求解器选择:支持多种求解器,包括
single_loop、hacksynth(规划-执行-总结架构)以及 Cursor 和 Claude Code 等外部 CLI 工具。 - 广泛的模型兼容性:通过 OpenRouter、NVIDIA NIM 和本地提供者(如 Ollama)支持多种模型。
- 追踪分析:提供 Web 查看器,可逐步回放求解过程,分析 LLM 的推理逻辑。
相关
- 项目
- 项目
- 项目
- 项目
- 项目