0ca/BoxPwnr
A modular framework for benchmarking LLMs and agentic strategies on security challenges across HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF and more.
解決的問題
BoxPwnr 是一個實驗性框架,旨在測試大型語言模型(LLMs)和 AI 代理在自主解決 Capture The Flag(CTF)挑戰與安全實驗室方面的能力。它提供了一種標準化的方法,用於在多個網路安全平台之間,對不同代理架構進行基準測試。
工作原理
系統透過一個迭代執行循環運作:
- 環境:命令通常在隔離的 Kali Linux Docker 容器中執行,必要時會自動設定 VPN。
- 代理循環:LLM(或 Claude Code、Grok 等 CLI 代理)接收系統提示並提出命令。這些命令在環境中執行,輸出結果會回饋給 LLM 進行分析。
- 自動化:代理被指示提供完全自動化的命令,以避免手動干預。
- 追蹤:系統記錄完整的對話日誌(追蹤),追蹤 token 使用量與成本,並在成功時產生摘要。
適用對象
適合對 AI 安全、代理工作流程,以及在複雜真實安全情境中評估 LLM 推理與問題解決能力的研究人員與開發者。
主要亮點
- 廣泛的平台支援:整合 16 個不同平台,包括 HackTheBox、PortSwigger、picoCTF、TryHackMe 和 XBOW。
- 彈性的求解器選擇:支援多種求解器,包括
single_loop、hacksynth(規劃-執行-總結架構)以及 Cursor 和 Claude Code 等外部 CLI 工具。 - 廣泛的模型相容性:透過 OpenRouter、NVIDIA NIM 和本地提供者(如 Ollama)支援多種模型。
- 追蹤分析:提供 Web 查看器,可逐步重播求解過程,分析 LLM 的推理邏輯。
相關
- 專案
- 專案
- 專案
- 專案
- 專案