AISecurityLab/hackagent

HackAgent is an open-source security toolkit to detect vulnerabilities of your AI Agents

해결하는 문제

HackAgent는 AI 에이전트의 취약점을 탐지하기 위해 설계된 보안 레드팀 툴킷입니다. 전통적인 보안 도구가 탐지할 수 없는 프롬프트 인젝션, 점프브레이킹, 목표 탈취, 도구 오용 등의 위험을 해결합니다.

작동 방식

공격 엔진, 생성용 LLM, 평가용 LLM으로 구성된 모듈식 파이프라인을 사용합니다. 공격 엔진은 PAIR, TAP, AutoDAN-Turbo와 같은 연구 기반 공격 기법을 조율하고, 생성용 LLM은 악성 프롬프트를 생성하며, 평가용 LLM은 안전성 조치가 우회되었는지 여부를 판단합니다. 이 과정은 LangChain, OpenAI SDK, LiteLLM, Google ADK 등의 프레임워크로 구축된 타겟 에이전트를 테스트할 수 있도록 자동화되어 있습니다.

대상 사용자

AI 에이전트의 견고성을 평가하고 강화하고자 하는 보안 연구자, 개발자, AI 안전 전문가를 위한 것입니다.

주요 특징

  • 자동화된 레드팀: 다양한 고급 공격 기법을 사용하여 보안 결함을 자동으로 탐지합니다.
  • 광범위한 프레임워크 지원: LangChain 및 OpenAI SDK와 같은 주요 AI 에이전트 프레임워크와 호환됩니다.
  • 유연한 보고서 기능: 로컬 SQLite 기반 대시보드와 클라우드 기반 보고서 플랫폼을 모두 제공합니다.
  • 간편한 배포: Python SDK, CLI, 여러 플랫폼용 스탠드얼론 바이너리로 제공됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트