Goochbeater/Spiritual-Spell-Red-Teaming

A repo for jailbreaking various LLMs, mainly Claude

解决的问题

本项目解决了对 AI 模型进行安全测试(红队测试)的需求,特别关注识别可能使用户绕过安全过滤器并生成受限内容的漏洞。

工作原理

该项目提供了一套用于测试 AI 模型鲁棒性的技术与提示。重点在于“精神”或创造性的红队测试,通过复杂的提示工程,发现模型如何被操纵以忽略其安全指南。

适用人群

适用于希望通过模拟对抗性攻击来评估模型安全性和对齐性的安全研究人员和 AI 开发者。

主要亮点

  • 专注于 AI 模型的红队测试与安全研究。
  • 提供测试安全过滤器绕过的方法。
  • 旨在通过对抗性测试提升模型的鲁棒性。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • Dispatch