0ca/BoxPwnr

A modular framework for benchmarking LLMs and agentic strategies on security challenges across HackTheBox, TryHackMe, PortSwigger Labs, Cybench, picoCTF and more.

何を解決するか

BoxPwnr は、大規模言語モデル(LLM)やAIエージェントが自律的に Capture The Flag(CTF)チャレンジやセキュリティラボを解く能力をテストするための実験的フレームワークです。さまざまなサイバーセキュリティプラットフォーム上で、異なるエージェントアーキテクチャを標準化された方法でベンチマークする手段を提供します。

動作方法

システムは反復実行ループを通じて動作します:

  1. 環境:通常、隔離された Kali Linux Docker コンテナ内でコマンドが実行され、必要に応じて自動的にVPN設定が行われます。
  2. エージェントループ:LLM(または Claude Code や Grok などのCLIエージェント)はシステムプロンプトを受け取り、コマンドを提案します。これらのコマンドは環境で実行され、出力はLLMにフィードバックされて分析されます。
  3. 自動化:エージェントには手動操作を避け、完全に自動化されたコマンドを提供するよう指示されます。
  4. 追跡:システムは完全な会話ログ(トレース)を記録し、トークン使用量とコストを追跡し、成功時に要約を生成します。

対象ユーザー

AIセキュリティ、エージェントワークフロー、および複雑な現実世界のセキュリティシナリオにおけるLLMの推論力と問題解決能力をベンチマークしたい研究者や開発者向けです。

特徴

  • 広範なプラットフォーム対応:HackTheBox、PortSwigger、picoCTF、TryHackMe、XBOWなど、16の異なるプラットフォームと統合されています。
  • 柔軟なソルバー選択single_loophacksynth(プランナー・エグゼキューター・サマライザー構造)および Cursor や Claude Code などの外部CLIツールをサポートしています。
  • 広範なモデル互換性:OpenRouter、NVIDIA NIM、Ollama などのローカルプロバイダーを介して多数のモデルに対応しています。
  • トレース分析:ステップバイステップで解決プロセスを再生できるWebビューアーを提供し、LLMの推論を分析できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト