0ca/BoxPwnr
A modular framework for benchmarking LLMs and agentic strategies on security challenges across HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF and more.
해결하는 문제
BoxPwnr는 대규모 언어 모델(LLM)과 AI 에이전트가 자율적으로 캡처 더 플래그(CTF) 도전 과제와 보안 랩을 해결할 수 있는 능력을 테스트하기 위해 설계된 실험적 프레임워크입니다. 다양한 사이버보안 플랫폼에서 다양한 에이전트 아키텍처를 표준화된 방식으로 벤치마킹할 수 있는 방법을 제공합니다.
작동 방식
시스템은 반복 실행 루프를 통해 작동합니다:
- 환경: 일반적으로 고립된 Kali Linux Docker 컨테이너 내에서 명령어가 실행되며, 필요 시 자동으로 VPN 설정이 수행됩니다.
- 에이전트 루프: LLM(또는 Claude Code, Grok과 같은 CLI 에이전트)는 시스템 프롬프트를 받고 명령어를 제안합니다. 이 명령어는 환경에서 실행되고, 출력 결과는 다시 LLM에 피드백되어 분석됩니다.
- 자동화: 에이전트는 수동 상호작용을 피하기 위해 완전히 자동화된 명령어를 제공하도록 지시됩니다.
- 추적: 시스템은 전체 대화 로그(트레이스)를 기록하고, 토큰 사용량과 비용을 추적하며, 성공 시 요약을 생성합니다.
대상 사용자
AI 보안, 에이전트 워크플로우, 그리고 복잡한 실제 세계의 보안 시나리오에서 LLM의 추론 및 문제 해결 능력을 벤치마킹하고자 하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 광범위한 플랫폼 지원: HackTheBox, PortSwigger, picoCTF, TryHackMe, XBOW 등 16개 이상의 다양한 플랫폼과 통합됩니다.
- 유연한 솔버 선택:
single_loop,hacksynth(플래너-실행기-요약기 아키텍처), Cursor 및 Claude Code와 같은 외부 CLI 도구를 지원합니다. - 광범위한 모델 호환성: OpenRouter, NVIDIA NIM, Ollama와 같은 로컬 제공자 등을 통해 다양한 모델과 호환됩니다.
- 트레이스 분석: 단계별로 해결 과정을 재생할 수 있는 웹 뷰어를 제공하여 LLM의 추론 과정을 분석할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트