Vasco0x4/AIDA

Turn any LLM into an autonomous pentester. You define the scope, the agent does the work, you review the findings.

AIDA – AI驱动的自主渗透测试代理

是什么 – AIDA(AI驱动安全评估)是一个开源工具,可将大型语言模型(Claude、Gemini、OpenAI Codex等)转变为自主渗透测试助手。它运行在Docker容器中,内置常见安全工具(nmap、sqlmap、ffuf、nuclei等),并可根据需要动态安装额外工具。LLM驱动整个工作流:制定评估计划、向容器发出命令、编写自定义Python载荷、构造原始HTTP请求,并将每一步操作记录在持久化笔记本中,支持后续恢复。


核心功能(如README所述)

功能 工作方式
执行环境 预构建的 aida-pentest Docker镜像(约2 GB),包含Linux shell和一套渗透测试工具。代理还可连接外部 Exegol 容器以获取更丰富的工具集。
工具调用LLM 任何支持工具调用的LLM(Claude Code、OpenAI Codex、Kimi、Gemini或任何OpenAI兼容API)均可使用。模型通过 python3 aida.py 调用,接收评估范围后,发出 execute()scan()http_request() 等调用。
动态Python载荷 代理可在容器内生成并运行临时Python脚本,用于处理定制化利用或数据处理,这是现成工具无法胜任的任务。
类似Burp的HTTP控制 通过 http_request() 工具,模型可发送任意HTTP请求,使用 {{PLACEHOLDER}} 注入存储的凭证,并可操控头、Cookie、请求体等。
持久化笔记本与报告 所有发现、命令输出和推理过程均被记录。通过 add_card() 添加发现,会自动使用CVSS 4.0进行评分。仪表板(http://localhost:31337)可查看攻击时间线、导出PDF报告,并跨多个评估进行过滤。
认证与通知 v1.1.0新增JWT基于的用户角色、首次运行向导,以及可选的Telegram/Slack/邮件警报(附带PDF附件)。

快速开始(来自README)

# 克隆并启动UI容器
git clone https://github.com/Vasco0x4/AIDA.git
cd AIDA
./start.sh               # 在 http://localhost:31337 启动仪表板

# 运行代理(默认使用Claude Code)
python3 aida.py --assessment "target-corp"

可选标志允许选择特定模型(--cli codex)、无提示运行(--yes),或在局域网/公网暴露UI。


典型工作流程

  1. 定义范围 – 告诉AIDA目标URL、子域名及任何排除项。
  2. 让LLM规划并执行 – 它调用 scan()subdomain_enum()ssl_analysis() 等,如需则自动安装缺失工具。
  3. 审查发现 – 笔记本列出每个漏洞,包含:
    • 发现它的命令
    • 原始输出
    • 模型的推理
    • 自动生成的CVSS 4.0评分
  4. 导出/移交 – 一键导出PDF报告,或稍后继续执行。

现实世界影响(声称)

README列出了多个由AIDA + Claude发现的CVE(例如CVE-2026-49869、CVE-2026-50189),并已发布在公开漏洞数据库中。


限制与警告(作者指出)

  • 模型质量至关重要 – 更深入的评估需要更强大的LLM;该工具“模型无关”,但弱模型会产生浅层结果。
  • 容器暴露风险 – 仪表板应仅限本地或可信局域网;作者警告不要公开暴露。
  • 工具调用可靠性 – 代理依赖LLM正确调用预定义工具函数;格式错误的调用可能导致运行停滞。
  • 法律/伦理责任 – 用户必须获得测试目标的授权;AIDA仅自动化重复工作,人类评审员仍对优先级排序和披露负责。

许可证

AGPL-v3 – 代码必须保持开源,任何网络服务的修改都必须共享。


谁可能用得上?

  • 寻找快速、AI辅助侦察与利用框架的红队工程师。
  • 希望让LLM自动化重复扫描,从而专注于验证的漏洞赏金猎人。
  • 想评估当前LLM能多远驱动端到端渗透测试的安全研究人员。
  • 希望内部“助手”对自有资产执行基线评估的组织(需适当授权)。

总结

AIDA是一个真正的开源项目,将LLM工具调用与现成渗透测试容器结合,打造自主安全评估代理。它提供Web仪表板、持久化笔记本、CVSS评分和多模型支持,全部由语言模型决定执行哪些命令。项目积极维护(v1.1.0),并通过GitHub和Discord社区欢迎贡献。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目