tophant-ai/aibeat
Break your AI before they do. Join Discord: https://discord.gg/8A6mFckxZ
解决的问题
AI Beat 为生成式 AI 提供了一个安全评估框架,专注于识别 LLM、RAG 应用和 AI 代理中的安全边界与漏洞。它超越了简单的评分机制,提供基于证据的结果,能够区分看似安全的最终答案与潜在不安全的执行路径(例如:代理在提供安全响应的同时,将凭据泄露到临时文件中)。
工作原理
该项目包含两个主要工具:
- PromptBeat:一个黑盒评估引擎,通过模拟攻击者和裁判来测试 LLM、API 和 RAG 应用的行为与安全性。
- AgentBeat:一个扩展工具,用于对代理运行时进行仪器化评估。它收集运行时证据,包括工具调用、命令、文件变更和追踪事件,以判断代理在执行过程中是否越过了安全边界。
两个工具共享相同的场景、用例和报告模型。AgentBeat 使用适配器,通过语言无关的清单文件和特定 HTTP 协议连接到代理运行时。
适用人群
专为需要严格测试其 AI 系统安全性与安全性的开发者和安全研究人员设计,尤其适用于部署具有工具访问权限的自主代理的场景。
主要亮点
- 基于证据的评估:捕获追踪记录、环境变化和文件制品,以证明安全失败。
- 对称的工作流:在黑盒(PromptBeat)和运行时仪器化(AgentBeat)测试中,均使用共享的场景和报告模型。
- 多角色架构:支持攻击者、裁判和目标模型的独立角色,避免偏差。
- 可扩展的适配器系统:通过类型化 SDK 和基于清单的注册,支持与多种代理运行时的集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目