whitzard-ai/jade-db
"他山之石、可以攻玉":复旦JADE团队发布的大模型测评与治理系列
解决的问题
JADE 解决了评估大语言模型(LLMs)安全防护机制的挑战。它特别解决了「低触发率」问题——标准安全测试往往无法绕过模型的安全过滤器——通过生成有针对性的高风险测试数据集,有效探测模型对齐中的漏洞。
工作原理
该平台使用语言变异技术,自动将低触发率的「种子问题」转化为高风险问题。这些变异生成的文本自然流畅,更可能绕过安全过滤器。生成的数据集涵盖四大主要类别:核心价值观、非法活动、权利侵犯和歧视/偏见,覆盖超过30个子类别。
适用人群
专为需要严格测试 LLM、多模态模型和 AI 代理安全对齐的 AI 研究人员、开发者和安全审计人员设计,确保它们不会生成有害或非法内容。
主要亮点
- 语言变异:从简单种子自动生成高风险提示,以更好地测试模型鲁棒性。
- 全面覆盖:涵盖中文和英文模型在各类安全领域(如非法行为、隐私侵犯和偏见)的数据集。
- 多版本基准:提供不同难度级别,包括 Easy、Medium 和高风险(跨模型可迁移)数据集。
- 扩展生态系统:包含针对电话代理(Jade-BadPhoneAgent)、多模态幻觉(Jade-HAL)和推理链安全(Jade-LRMGuard)的专用工具。
相关
- 项目
- 项目
- 项目
- Dispatch
- Dispatch