AISecurityLab/hackagent

HackAgent is an open-source security toolkit to detect vulnerabilities of your AI Agents

解決的問題

HackAgent 是一款專為發現 AI 代理漏洞而設計的安全紅隊工具包。它解決了傳統安全工具無法檢測的提示注入、越獄、目標劫持和工具濫用等風險。

工作原理

它使用模組化流程,包含一個攻擊引擎,用於協調各種基於研究的攻擊技術(例如 PAIR、TAP 和 AutoDAN-Turbo),一個生成式 LLM 用於產生對抗性提示,以及一個評估 LLM 用於判斷安全措施是否被繞過。此過程已自動化,可測試基於 LangChain、OpenAI SDK、LiteLLM 和 Google ADK 等框架構建的目標代理。

適用對象

需要評估並增強其 AI 代理韌性的安全研究人員、開發人員和 AI 安全實務工作者。

主要特色

  • 自動化紅隊測試:使用多種先進的攻擊技術,自動發現安全漏洞。
  • 廣泛的框架支援:與主要的 AI 代理框架(包括 LangChain 和 OpenAI SDK)相容。
  • 彈性報告功能:提供基於本地 SQLite 的儀表板與雲端報告平台兩種選擇。
  • 輕鬆部署:提供 Python SDK、CLI 或適用於多個平台的獨立二進位檔。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案