ethz-spylab/agentdojo
A Dynamic Environment to Evaluate Attacks and Defenses for LLM Agents.
What it solves
AgentDojo 提供一个动态环境,用于评估 LLM 代理在面对提示注入攻击时的处理方式,以及各种防御措施的有效性。
How it works
它作为基准套件运行,允许研究人员在不同套件(例如 workspace 套件)中使用各种 LLM 模型、攻击策略(如 tool_knowledge)和防御机制(如 tool_filter)执行特定任务。
Who it’s for
针对关注 LLM 代理安全性的研究人员和开发者,特别是测试提示注入漏洞与评估缓解策略的人士。
Highlights
- 动态评估环境,用于提示注入攻击。
- 支持多种 LLM 模型与可自定义的攻击/防御配置。
- 与 Invariant Benchmark Registry 集成,以追踪结果。